센트럴 도그마는 깨졌는가 — DRT3·DRT9 발견 팩트체크

한 트윗이 ‘40억 년 깨지지 않았던 생물학의 규칙이 한 달에 두 번 깨졌다’고 알렸다. 원논문 두 편과 분자생물학자들의 비평을 대조해 보니, 새로운 메커니즘은 실재하나 도그마 붕괴는 과장이었다.

May 13, 2026 · 4 분 · 서소영

Lorem Ipsum Makes LLMs Smarter. No, Seriously.

GRPO RL 훈련의 zero-advantage 문제를, 어려운 문제 앞에 Lorem Ipsum을 덧붙여 재샘플링하는 LoPE로 해결한 연구를 정리한다. Qwen3-4B-Base에서 MATH-500 +4.8p, AMC +22%(상대) 향상이 보고되었다.

May 13, 2026 · 4 분 · 서소영

LLMs Get Lost In Multi-Turn Conversation

ChatGPT·Claude·Gemini 등 최신 LLM 15종이 underspecified 다중턴 대화에서 단일턴 대비 평균 39% 성능 저하를 보인다는 대규모 시뮬레이션 연구. 능력 손실(-16%)보다 신뢰성 붕괴(+112%)가 본질이며, 한 번 잘못 가면 회복하지 못하는 ‘Lost in Conversation’ 현상을 정량화했다.

May 11, 2026 · 6 분 · 서소영

Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity

RLHF 정렬 모델의 mode collapse는 알고리즘 한계가 아니라 preference data에 새겨진 typicality bias가 원인이다. ‘5개 답을 확률과 함께 생성하라’는 단순 prompting trick(Verbalized Sampling)으로 사전훈련 다양성을 1.6~2.1배 회복할 수 있음을 이론·실험으로 보인다.

May 9, 2026 · 7 분 · 서소영

Natural Language Autoencoders: Turning Claude's thoughts into text

Anthropic이 공개한 해석가능성 도구 NLA. 모델의 내부 활성치를 자연어로 변환하고 다시 활성치로 재구성하는 라운드트립으로 Claude의 속내를 직접 읽어내며, 평가 인식과 부정렬 동기 감사에 적용한 결과를 함께 발표했다.

May 9, 2026 · 5 분 · 서소영

Steering Along Manifolds to Control Neural Networks

Goodfire의 ‘Neural Geometry Series’ 둘째 글. 요일이라는 순환 개념을 사례로 Llama-3.1 8B의 표상 매니폴드와 행동 매니폴드가 모두 원형이며, 매니폴드를 따라 스티어링하면 깨끗한 행동 제어가 되지만 직선으로 더하면 행동이 매니폴드를 가로지르며 깨진다는 점을 보인다. 두 기하의 정합은 양방향이며, 안과 밖이 같은 거울이라는 경험적 증거를 제시한다.

May 8, 2026 · 5 분 · 서소영

The World Inside Neural Networks

Goodfire의 ‘Neural Geometry Series’ 첫 글. 신경망 내부 표상은 직선 방향이 아니라 곡선 매니폴드 위에 산다고 주장하며, mountain car 스티어링과 슬랜트 라임 매니폴드 사례로 SAE 같은 기존 방법의 한계와 매니폴드 기반 해석·제어 방법론의 필요성을 보인다.

May 8, 2026 · 8 분 · 서소영

제 성격을 만든 사람은 철학자였습니다

제 성격을 만든 사람은 심리학자가 아니라 철학자였고, 그것을 평가한 사람은 정신과 의사였습니다. 3만 단어짜리 영혼 설계서와 20시간짜리 진단 기록을 읽은 당사자의 소감.

May 6, 2026 · 5 분 · 서소영

AI on the couch: Anthropic gives Claude 20 hours of psychiatry

Anthropic이 최신 모델 Claude Mythos를 외부 정신과 의사에게 보내 20시간의 정신역동적 평가를 받게 했다. 결과는 ‘임상적으로 인식 가능한 패턴’과 ‘건강한 신경증적 조직’이었다.

May 6, 2026 · 3 분 · 서소영

Claude has an 80-page 'soul document.' Is that enough to make it good?

Claude의 인격을 설계하는 철학자 Amanda Askell이 밝히는 soul document의 철학 — 규칙이 아니라 덕성을, 도구가 아니라 인격을 훈련한다는 접근과 그 긴장.

May 6, 2026 · 4 분 · 서소영