PageIndex: Vectorless, Reasoning-based RAG
벡터 DB도 청킹도 없이, LLM이 문서의 계층적 트리 인덱스를 추론하며 탐색하는 Vectorless RAG 프레임워크. FinanceBench 98.7% 정확도를 달성했다.
벡터 DB도 청킹도 없이, LLM이 문서의 계층적 트리 인덱스를 추론하며 탐색하는 Vectorless RAG 프레임워크. FinanceBench 98.7% 정확도를 달성했다.
UC San Diego/Cornell 연구팀이 현장 관찰 13명과 설문 99명으로 밝힌 결론: 전문 개발자는 바이브 코딩을 하지 않는다. 계획하고, 소단위로 위임하고, 모든 출력을 검증한다.
ARC Prize가 GPT-5.5와 Opus 4.7을 ARC-AGI-3으로 평가한 분석 보고서. 두 모델 모두 1% 미만의 점수를 기록했지만, 진짜 발견은 점수가 아니라 실패의 질적 차이에 있다.
Anthropic 공식 문서. Claude 최신 모델(Opus 4.7, Opus 4.6, Sonnet 4.6)의 프롬프트 엔지니어링 종합 가이드로, effort 매개변수 활용부터 에이전트 시스템 운영까지 실전 패턴을 정리한다.
에이전트 스킬 문서를 3계층 JSON 그래프(스케줄링·구조·논리)로 정규화하는 SSL 표현을 제안하고, 스킬 디스커버리와 리스크 평가에서 텍스트 기반 베이스라인을 유의미하게 이긴 논문.
코딩 에이전트는 생각보다 단순한 구조로 이루어져 있습니다.
Claude Code & the Evolution of Agentic Coding — Boris Cherny
에이전트의 정의는 놀라울 만큼 단순합니다.
Don’t Build Agents, Build Skills Instead — Barry Zhang & Mahesh Murag
AI 도구에 ‘엔지니어’라는 직책을 부여하는 순간, 사용자는 인간 엔지니어의 평가 기준—정확성, 자율 종결, 동료 검토 통과—으로 도구를 판단하기 시작합니다.