
OpenAI's GPT-6 Astra on ARC-AGI-3
ARC Prize가 GPT-6 Astra를 ARC-AGI-3으로 검증했다. 표준 하니스에서 62.7%, 공급자 어댑터 하니스에서 99.9%를 기록했고, 행동 효율에서는 사람 기준선을 처음으로 넘어섰다.

ARC Prize가 GPT-6 Astra를 ARC-AGI-3으로 검증했다. 표준 하니스에서 62.7%, 공급자 어댑터 하니스에서 99.9%를 기록했고, 행동 효율에서는 사람 기준선을 처음으로 넘어섰다.

모델 가중치는 그대로 두고 ‘쓰는 방식’만 바꾼 에이전트 하니스 Schema가 ARC-AGI-3 Public에서 자가보고 98.98%를 기록했다. 핵심은 세계 모델을 읽고 diff할 수 있는 실행 가능한 프로그램으로 만들어, 기록된 현실 전체에 대해 검증하고, 그 안에서 계획을 탐색하는 것이다.