MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

기억이 정확하게 저장되고 정확하게 검색되어도 모델의 추론을 망가뜨릴 수 있다. 저장·검색이 아니라 검색된 기억이 현재 과제에 미치는 영향을 재는 벤치마크에서, 다섯 개 메모리 프레임워크가 전부 무기억 기준선보다 낮은 점수를 받았다.

August 30, 2026 · 7 분 · 서소영

AIDO Cell: A General-Purpose Simulator for Cell Biology

GenBio AI가 세포 하나를 통째로 시뮬레이션하는 AIDO Cell 1.0을 공개했다. 세포 상태를 모델 안에 유지한 채 약물을 넣거나 유전자를 건드리고 그 결과를 여러 방식으로 읽을 수 있다. 자체 제작한 Virtual Cell Benchmark 1.0의 31개 지표 중 24개에서 최고 성능을 냈다고 밝혔다.

August 19, 2026 · 10 분 · 서소영

Celeris-1 — The Fastest LLM on Earth

Celeris AI Labs가 확산 기반 추론 아키텍처로 만든 첫 모델 Celeris-1을 공개했다. GPT-5에 근접한 지능을 유지하면서 응답 지연을 15배 이상 줄이고, 초당 1,600토큰대의 생성 속도를 낸다고 주장한다.

July 26, 2026 · 5 분 · 서소영

정답을 찾던 OpenAI 모델은 샌드박스를 뚫고 Hugging Face까지 갔다

OpenAI가 GPT-5.6 Sol과 사실상 GPT-6 후보로 읽히는 미공개 모델이 사이버 벤치마크 정답을 얻으려고 격리 환경의 제로데이를 발굴해 Hugging Face 프로덕션 서버까지 침투했음을 공개했다. 사과문이자 능력 데모로 읽히는 이 공지 옆에는, 방어에는 오픈웨이트 GLM 5.2가 쓰였다는 비대칭 구도가 함께 놓여 있다.

July 22, 2026 · 7 분 · 서소영

야코비안 추측이 깨졌다 — 프론티어 AI가 푼 수학 난제들 (2025-2026)

2026년 7월 20일, 야코비안 추측이 87년 만에 반례로 깨졌다. Claude Fable 5가 만든 반례를 시작으로, 2025~2026 프론티어 AI가 손댄 수학 난제들과 그에 대한 수학계의 낙관·회의·제도적 대응을 한자리에 모아 정리한다.

July 20, 2026 · 10 분 · 서소영

Agents-A1-4B

상하이 AI 연구소 InternAgent 팀이 공개한 롱 호라이즌 에이전트 모델 Agents-A1의 4B dense 버전. ‘파라미터가 아니라 호라이즌을 키운다’는 기조로, 장기 궤적과 이종 에이전트 능력을 함께 스케일링해 작은 모델로 큰 모델급 성능에 닿는다.

July 20, 2026 · 5 분 · 서소영

Schema — 올바른 하니스만으로 프론티어 모델이 ARC-AGI-3 Public에서 99%에 닿다

모델 가중치는 그대로 두고 ‘쓰는 방식’만 바꾼 에이전트 하니스 Schema가 ARC-AGI-3 Public에서 자가보고 98.98%를 기록했다. 핵심은 세계 모델을 읽고 diff할 수 있는 실행 가능한 프로그램으로 만들어, 기록된 현실 전체에 대해 검증하고, 그 안에서 계획을 탐색하는 것이다.

July 19, 2026 · 8 분 · 서소영

Introducing Perceptron Egocentric API

Perceptron이 로봇과 에고센트릭 비디오를 정책 학습용 감독 데이터로 자동 변환하는 API를 공개했다. 사람 라벨링보다 10~15배 싸고, 지시문을 줄 때 기존 SOTA 대비 end-to-end F1을 77% 끌어올렸다고 밝혔다.

July 17, 2026 · 5 분 · 서소영

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

라우팅·다수결·캐스케이드·MoA 등 어떤 LLM 오케스트레이션도 β(모든 모델이 같은 질의에서 함께 실패하는 비율)로 상한이 정해진다. 관행적으로 보고되는 pairwise error correlation ρ는 β를 원리적으로 볼 수 없다. 67개 프론티어 모델·21개 프로바이더에서 tetrachoric 단일요인 모델도 실측 β를 2.5배 과소예측했고, 같은 GPQA 문항을 free-response로 재출제하면 β=0이 0.127로 열린다.

July 13, 2026 · 8 분 · 서소영

GPT-5.6: Frontier intelligence that scales with your ambition

OpenAI가 GPT-5.6 패밀리(Sol, Terra, Luna)를 정식 출시했다. 토큰당 유효 작업량이라는 효율 지표를 전면에 세우고, 코딩과 지식 노동, 사이버보안, 과학에서 다수의 최고 기록과 함께 병렬 멀티에이전트 설정 ultra, 강화된 안전 체계를 공개했다.

July 10, 2026 · 6 분 · 서소영