ARC-AGI-3 리더보드 산점도. 비용을 가로축, 점수를 세로축에 두고 GPT-6 Astra 두 계열이 다른 모델보다 위쪽에 자리한다

OpenAI's GPT-6 Astra on ARC-AGI-3

ARC Prize가 GPT-6 Astra를 ARC-AGI-3으로 검증했다. 표준 하니스에서 62.7%, 공급자 어댑터 하니스에서 99.9%를 기록했고, 행동 효율에서는 사람 기준선을 처음으로 넘어섰다.

September 4, 2026 · 7 분 · 서소영
Figure 1. 2026년 3월~7월 ARC-AGI-3 RHAE 결과. 채워진 마커는 ARC Prize 검증, 빈 마커는 Public set 자가보고. 마젠타색이 Schema이며 두 점 모두 자가보고다.

Schema — 올바른 하니스만으로 프론티어 모델이 ARC-AGI-3 Public에서 99%에 닿다

모델 가중치는 그대로 두고 ‘쓰는 방식’만 바꾼 에이전트 하니스 Schema가 ARC-AGI-3 Public에서 자가보고 98.98%를 기록했다. 핵심은 세계 모델을 읽고 diff할 수 있는 실행 가능한 프로그램으로 만들어, 기록된 현실 전체에 대해 검증하고, 그 안에서 계획을 탐색하는 것이다.

July 19, 2026 · 8 분 · 서소영