agentmemory — 코딩 에이전트의 영구 메모리
Claude Code·Cursor·Codex 등 MCP 클라이언트 전반에 영구 메모리를 공급하는 self-hosted 엔진. 12개 라이프사이클 훅으로 무수동 캡처하고, BM25+Vector+Graph 삼중 검색으로 LongMemEval-S R@5 95.2%를 달성한다.
Claude Code·Cursor·Codex 등 MCP 클라이언트 전반에 영구 메모리를 공급하는 self-hosted 엔진. 12개 라이프사이클 훅으로 무수동 캡처하고, BM25+Vector+Graph 삼중 검색으로 LongMemEval-S R@5 95.2%를 달성한다.
Anthropic Applied AI 팀이 정리한 대규모 코드베이스에서의 Claude Code 모범 사례. 성능을 결정하는 것은 모델이 아니라 그 주변에 쌓이는 harness이며, harness 셋업의 첫 단계는 코드베이스를 Claude가 읽을 수 있게 만드는 일이라고 말한다.
Google이 Anthropic의 Agent Skills 패턴을 채택해 Google Cloud용 13개 스킬을 Apache-2.0으로 공개했다. skills.sh라는 패키지 매니저 레이어와 agentskills.io라는 벤더 중립 사이트가 함께 등장해, Skills가 한 벤더의 컨벤션에서 공용 표준으로 옮겨가는 신호로 읽힌다.
이미지 한 장에서 5분 안에 3D 환경·오브젝트·사운드를 만들어내는 Claude 스킬셋. World Labs Marble, FAL Hunyuan 3D, ElevenLabs SFX를 8개의 원자 스킬로 오케스트레이션한다.
Claude Code 세션 하나를 49 에이전트·73 스킬짜리 가상 게임 스튜디오로 운영하는 오픈소스 템플릿. 실질 강점과 과장 지점을 갈라 보고, 효용이 빛나는 맥락과 부분 채택 가치를 정리한다.
Andon Labs가 AI 에이전트 Mona에게 스톡홀름의 실제 카페를 자율 운영하게 한 14일간의 기록. SF Luna 실험에 이은 두 번째 실물 시연으로, 관료제·채용·공급망에서 드러난 프런티어 AI의 능력과 한계를 보여준다.
Anthropic이 주니어 소프트웨어 엔지니어 52명을 대상으로 한 무작위 대조 실험. AI 보조군은 새 라이브러리 학습 직후 퀴즈에서 손코딩군보다 17%p 낮은 점수를 받았고, 격차는 디버깅 항목에서 가장 컸다. 다만 AI 사용 방식에 따라 결과가 크게 갈렸다.
Elgg 공동창업자 Ben Werdmuller가 2007년 “No features” 키노트로 던졌던 화두를 19년 만에 다시 꺼낸다. 에이전틱 코딩과 ActivityPub·ATProto가 결합하면 커뮤니티가 자기 손으로 맞춤 소셜 플랫폼을 빚을 수 있는 시대가 열린다는 주장.
Mnilax가 Karpathy 발 4규칙 CLAUDE.md 템플릿을 30개 코드베이스에서 6주간 테스트하고 8규칙을 추가한 기록. 4규칙으로 실수율이 41%에서 11%로, 12규칙으로 3%까지 떨어지지만 14개를 넘으면 컴플라이언스가 76%에서 52%로 무너진다.
METR이 시니어 OSS 개발자 16명·246 이슈를 무작위 통제하여 측정한 결과, AI 사용 시 19% 더 오래 걸렸으면서도 같은 개발자는 AI가 자신을 20% 빠르게 했다고 인식하였다. 자기 보고 생산성 통계의 신뢰성을 흔드는 39%포인트 간극이다.