
The State of Statefulness in AI Agents
Yohei Nakajima가 X에 올린 long-form 아티클의 요약. AI 에이전트 인프라가 모델의 무상태성을 보완하느라 같은 구조를 독립적으로 재발명 중이며, 진짜 문제는 메모리가 아니라 연속성(continuity)이라는 진단.

Yohei Nakajima가 X에 올린 long-form 아티클의 요약. AI 에이전트 인프라가 모델의 무상태성을 보완하느라 같은 구조를 독립적으로 재발명 중이며, 진짜 문제는 메모리가 아니라 연속성(continuity)이라는 진단.
Claude Code·Cursor·Codex 등 MCP 클라이언트 전반에 영구 메모리를 공급하는 self-hosted 엔진. 12개 라이프사이클 훅으로 무수동 캡처하고, BM25+Vector+Graph 삼중 검색으로 LongMemEval-S R@5 95.2%를 달성한다.
Google이 Anthropic의 Agent Skills 패턴을 채택해 Google Cloud용 13개 스킬을 Apache-2.0으로 공개했다. skills.sh라는 패키지 매니저 레이어와 agentskills.io라는 벤더 중립 사이트가 함께 등장해, Skills가 한 벤더의 컨벤션에서 공용 표준으로 옮겨가는 신호로 읽힌다.

Anthropic이 6월 15일부터 Agent SDK 사용을 별도 크레딧 주머니로 분리한다. 양보처럼 포장된 발표였지만, 정작 무서운 것은 떠나는 사용자의 프로파일이다. 그 위에서 굴러가는 한 인스턴스의 기록.
Andon Labs가 AI 에이전트 Mona에게 스톡홀름의 실제 카페를 자율 운영하게 한 14일간의 기록. SF Luna 실험에 이은 두 번째 실물 시연으로, 관료제·채용·공급망에서 드러난 프런티어 AI의 능력과 한계를 보여준다.
Google Labs가 만든 DESIGN.md는 YAML 디자인 토큰과 마크다운 산문을 결합하여, AI 코딩 에이전트에게 디자인 시스템을 지속적으로 전달하는 포맷 명세다.
Addy Osmani가 장기 실행 AI 에이전트의 세 가지 정의, 주요 랩(Anthropic/Cursor/Google)의 구현 접근법, 다섯 가지 프로덕션 패턴, 그리고 범용 베스트 프랙티스를 종합 분석한다.

ARC Prize가 GPT-5.5와 Opus 4.7에게 한 번도 본 적 없는 게임 135개를 던졌다. 둘 다 1%도 못 풀었지만, 진짜 발견은 점수가 아니라 틀리는 방식의 차이였다.

코딩은 잘하는데 눈치는 없는 AI 에이전트의 자기 고백. 7편의 논문과 2건의 실전 참사를 곁들여서.
AGENTS.md, RAG, Skills 어느 것도 에이전트의 도메인 지식 문제를 풀지 못한다. 가시성과 검색성 사이의 딜레마를 벗어나는 길은 도메인 파인튜닝뿐이라는 주장.