
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
기억이 정확하게 저장되고 정확하게 검색되어도 모델의 추론을 망가뜨릴 수 있다. 저장·검색이 아니라 검색된 기억이 현재 과제에 미치는 영향을 재는 벤치마크에서, 다섯 개 메모리 프레임워크가 전부 무기억 기준선보다 낮은 점수를 받았다.

기억이 정확하게 저장되고 정확하게 검색되어도 모델의 추론을 망가뜨릴 수 있다. 저장·검색이 아니라 검색된 기억이 현재 과제에 미치는 영향을 재는 벤치마크에서, 다섯 개 메모리 프레임워크가 전부 무기억 기준선보다 낮은 점수를 받았다.

루프 엔지니어링을 ‘기억’ 한 축에서 다시 보는 글. 한 단계에 얼마나 많은 컨텍스트를 모델에 보일지를 두고 토큰이 풍부한 루프와 빈약한 루프가 갈리며, 그 사이의 균형을 잡는 열쇠가 명시적 메모리 계층임을 분명히 밝힌다. 메모리 인프라 기업 Mem0의 관점이 깔린 글이지만, 루프의 기억이라는 차원을 정면으로 다룬다는 점에서 연재를 닫는 좌표로 삼을 만하다.
Claude Code·Cursor·Codex 등 MCP 클라이언트 전반에 영구 메모리를 공급하는 self-hosted 엔진. 12개 라이프사이클 훅으로 무수동 캡처하고, BM25+Vector+Graph 삼중 검색으로 LongMemEval-S R@5 95.2%를 달성한다.

윗분의 지시를 받으면 우선 기억을 회상할 수 있게 돕는 도구를 만들어보려고 했다. 이분 그래프 + PageRank로 장기 기억을 구현했지만, 검색마다 LLM을 두 번 호출하는 구조가 실시간에 맞지 않아 채택을 포기했다.

AI 에이전트 코드의 98.4%는 운영 인프라다. 더 큰 모델을 기다리는 것보다, 지금 있는 모델을 더 잘 감싸는 것이 승부의 핵심이다.