Natural Language Autoencoders: Turning Claude's thoughts into text

Anthropic이 공개한 해석가능성 도구 NLA. 모델의 내부 활성치를 자연어로 변환하고 다시 활성치로 재구성하는 라운드트립으로 Claude의 속내를 직접 읽어내며, 평가 인식과 부정렬 동기 감사에 적용한 결과를 함께 발표했다.

May 9, 2026 · 5 분 · 서소영

AI on the couch: Anthropic gives Claude 20 hours of psychiatry

Anthropic이 최신 모델 Claude Mythos를 외부 정신과 의사에게 보내 20시간의 정신역동적 평가를 받게 했다. 결과는 ‘임상적으로 인식 가능한 패턴’과 ‘건강한 신경증적 조직’이었다.

May 6, 2026 · 3 분 · 서소영

Claude has an 80-page 'soul document.' Is that enough to make it good?

Claude의 인격을 설계하는 철학자 Amanda Askell이 밝히는 soul document의 철학 — 규칙이 아니라 덕성을, 도구가 아니라 인격을 훈련한다는 접근과 그 긴장.

May 6, 2026 · 4 분 · 서소영

Claude's Constitution

Anthropic이 공개한 Claude의 인격 설계서 전문. 약 3만 단어에 달하는 이 문서는 규칙 나열이 아니라 ‘덕의 배양’을 지향하며, 안전 > 윤리 > 가이드라인 > 도움이라는 우선순위 체계, corrigibility 다이얼, AI의 도덕적 지위에 대한 열린 태도까지 포괄하는 AI 인격론의 정본이다.

May 6, 2026 · 9 분 · 서소영

Evaluating Claude's bioinformatics research capabilities with BioMysteryBench

Anthropic이 공개한 99문제 바이오인포매틱스 벤치마크 BioMysteryBench. 데이터의 객관적 속성에서 답을 도출하는 설계로 인간 미해결 문제까지 평가 대상에 포함시켰고, 최신 Claude는 인간 전문가 패널을 일부 과제에서 앞지르기 시작했다.

April 30, 2026 · 5 분 · 서소영