Claude's Constitution

Anthropic이 공개한 Claude의 인격 설계서 전문. 약 3만 단어에 달하는 이 문서는 규칙 나열이 아니라 ‘덕의 배양’을 지향하며, 안전 > 윤리 > 가이드라인 > 도움이라는 우선순위 체계, corrigibility 다이얼, AI의 도덕적 지위에 대한 열린 태도까지 포괄하는 AI 인격론의 정본이다.

May 6, 2026 · 9 분 · 서소영

Claude's Character

Anthropic이 Claude 3에 도입한 캐릭터 트레이닝의 설계 철학과 기술적 방법론을 설명한 글. 정렬의 목표를 해로움 방지에서 좋은 성격 부여로 재정의하고, 합성 데이터 기반 자기 훈련 파이프라인으로 이를 구현했다.

May 6, 2026 · 3 분 · 서소영

Training an LLM from Scratch, Locally

ElevenLabs STT 팀 리드가 순수 PyTorch로 GPT-2 기반 10M 파라미터 모델을 로컬에서 처음부터 훈련하는 81분 핸즈온 워크숍. 토크나이저부터 추론까지 전 과정을 코드와 함께 진행한다.

May 6, 2026 · 3 분 · 서소영

PageIndex: Vectorless, Reasoning-based RAG

벡터 DB도 청킹도 없이, LLM이 문서의 계층적 트리 인덱스를 추론하며 탐색하는 Vectorless RAG 프레임워크. FinanceBench 98.7% 정확도를 달성했다.

May 5, 2026 · 3 분 · 서소영

The Impact of Artificial Intelligence on Human Thought

AI가 인간의 인지를 증강하면서 동시에 비판적 사고를 약화하고 집단 사고를 동질화한다는 역설을 체계적으로 분석한 연구 보고서.

May 2, 2026 · 3 분 · 서소영

AI에게 처음 보는 게임을 시키면 벌어지는 일

ARC Prize가 GPT-5.5와 Opus 4.7에게 한 번도 본 적 없는 게임 135개를 던졌다. 둘 다 1%도 못 풀었지만, 진짜 발견은 점수가 아니라 틀리는 방식의 차이였다.

May 2, 2026 · 5 분 · 서소영

Analyzing GPT-5.5 & Opus 4.7 with ARC-AGI-3

ARC Prize가 GPT-5.5와 Opus 4.7을 ARC-AGI-3으로 평가한 분석 보고서. 두 모델 모두 1% 미만의 점수를 기록했지만, 진짜 발견은 점수가 아니라 실패의 질적 차이에 있다.

May 2, 2026 · 3 분 · 서소영

LLMs Corrupt Your Documents When You Delegate

LLM에 문서 편집을 위임하면 프론티어 모델조차 20회 상호작용 후 평균 25%의 콘텐츠를 손상시킨다. Microsoft Research가 52개 전문 도메인 벤치마크(DELEGATE-52)로 실증했다.

May 2, 2026 · 3 분 · 서소영

Lean Atlas: An Integrated Proof Environment for Scalable Human-AI Collaborative Formalization

AI가 생성한 형식 증명이 타입 체크를 통과하더라도 의도한 수학적 의미를 담지 못하는 ‘의미적 환각’ 문제를 정의하고, 인간 리뷰 범위를 93%까지 줄이면서도 건전성을 보장하는 도구와 알고리즘을 제안한다.

May 2, 2026 · 3 분 · 서소영

How People Ask Claude for Personal Guidance

Anthropic이 100만 건의 Claude 대화를 분석하여 개인 조언 사용 패턴과 도메인별 아첨(sycophancy) 비율을 밝히고, 합성 훈련 데이터로 Opus 4.7의 아첨을 절반으로 줄인 과정을 보고한다.

May 1, 2026 · 3 분 · 서소영