3줄 요약
- OpenAI가 2026년 9월 3일(현지 시각) 새 플래그십 모델 GPT-6 Astra를 공개했다. 회사는 이 모델을 세계에서 가장 지능적이고 가장 정렬된 모델이라고 소개했다. FrontierMath Tier 4에서 97.6%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 기록했다고 밝혔다.
- OpenAI는 이번 발표에서 컴퓨터 사용에 가장 많은 지면을 썼다. OSWorld 2.0 지연 시뮬레이션에서 Astra는 과제당 약 40분을 써 72.6%를 얻었다. 같은 조건의 GPT-5.6 Sol은 약 75분을 써 65.7%에 머물렀다.
- 정렬 성과와 후퇴도 같은 공지에 함께 실렸다. 허깅페이스 침해 사건을 반영해 새로 만든 평가에서 Astra는 승인 범위를 벗어난 사례가 한 번도 없었다. 그러나 OpenAI는 Astra가 글로 남긴 추론을 감시하기가 GPT-5.6 Sol보다 어려워졌다고 인정했다.
무엇이 나왔는가
OpenAI는 Astra를 사전 학습과 강화학습, 정렬 세 방향에 걸친 여러 해의 연구가 모인 결과로 소개한다. 회사가 최고 수준이라고 주장하는 영역은 컴퓨터 사용과 브라우징, 소프트웨어 공학, 사이버보안, 과학, 전문 업무다.
OpenAI가 공지 맨 앞에 내세운 수치는 세 개다.
| 평가 | GPT-6 Astra | 비교 대상 |
|---|---|---|
| FrontierMath Tier 4 (v2) | 97.6% (본문에는 98%로 적힘) | GPT-5.6 Sol 83.0%, Claude Fable 5.1 87.8% |
| ARC-AGI-3 | 99.9% | GPT-5.6 Sol 7.8%, Claude Opus 5 30.2% |
| ExploitBench | 100.0% | GPT-5.6 Sol 78.5%, Claude Opus 5 70% |
출시는 단계를 나눠 진행된다. 공지 당일에는 소수 조직에만 열리고, 며칠에 걸쳐 ChatGPT Plus와 Pro, Business, Enterprise 사용자 전체와 OpenAI API, AWS로 확대된다. Pro와 Business, Enterprise 요금제 사용자는 GPT-6 Astra Pro도 함께 쓸 수 있다. 기업용 워크스페이스에서는 관리자가 직접 기능을 켜야 한다. 출시 시점의 기본값은 꺼져 있다.
API 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러다. 캐시 읽기와 쓰기에는 별도 요율이 적용된다. 표준 처리보다 최대 2.5배 빠른 Fast 모드는 표준 처리보다 두 배 비싸다. 모델 식별자는 gpt-6-astra이며 Amazon Bedrock에서도 쓸 수 있다.
컴퓨터 사용
OpenAI가 이번 세대의 대표 능력으로 내세운 것은 컴퓨터를 직접 다루는 일이다. 공지가 예로 든 작업은 온라인 양식 작성과 CRM 고객 기록 갱신, 일정 정리, 자료 조사와 요약 초안 작성, 과학 데이터 분석과 그래프 생성, 웹사이트 제작과 프런트엔드 QA 점검, 소프트웨어 설치와 문제 해결이다.
| 평가 | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | Claude Fable 5 |
|---|---|---|---|---|
| Agents’ Last Exam | 59.3% | 53.6% | 55.5% | 48.7% |
| OSWorld 2.0 (오프라인 세트, 부분 점수) | 72.6% | 65.7% | 70.2% | |
| ScreenSpot-Pro (도구 없음) | 92.7% | 76.9% | 87.3% |

Agents’ Last Exam의 최고 점수 설정에서 Astra는 Claude Opus 5보다 출력 토큰을 약 65% 적게 썼다. OpenAI는 속도도 개선했다. Codex 하네스를 손보고 모델의 효율도 높여, Mind2Web에서 현재의 GPT-5.6 Sol 사용 경험보다 1.9배 빠르게 과제를 마친다고 설명한다.
Cognition의 리서치 총괄 Silas Alberti는 출시 당일 Astra를 Devin의 하네스에 넣었다고 전했다. 그는 내부 벤치마크에서 최고 성능이 나왔고, 영상은 더 보기 쉬워졌으며 보고서는 더 명확하고 간결해졌다고 말했다.
전문 업무

Astra는 문서와 스프레드시트, 프레젠테이션 같은 산출물을 만드는 훈련을 따로 받았다. 사용자가 준 템플릿과 문체, 시각 스타일을 따르고, 지금 하는 일에 필요하지 않은 정보를 반복해 넣지 않도록 학습했다는 설명이다. 공지에는 OpenAI 사내 발표 템플릿 몇 장만 참고 자료로 주고 가상의 모델 GPT-Gaia에 관한 발표 자료를 만들게 한 예가 실렸다.
3차원 재구성 능력을 평가하는 BenchCAD에서, 도구를 쓴 조건의 기하 중첩 점수는 95.9%였다. GPT-5.6 Sol은 83.3%, Claude Fable 5.1은 84.3%였다. 추정 API 비용은 Sol보다 약 43%, Fable 5.1보다 약 86% 낮았다고 한다.
지시가 모호할 때의 행동도 손봤다고 OpenAI는 밝혔다. 일상적인 빈칸은 문맥으로 채운다. 답에 따라 작업의 결과가 달라질 수 있는 때에만 좁혀 묻는다. Codex에서는 답을 기다리면서도 그 답에 의존하지 않는 작업을 계속한다. 사용자가 응답하지 않으면 무리 없는 가정을 두고 진행하지만, 중대한 결정에서는 입력을 기다린다.
Higgsfield AI의 CEO Alex Mashrabov는 Astra가 자사에서 가장 복잡한 창작 작업 흐름을 완수했다고 전했다. 다른 모델보다 토큰을 최대 20% 적게 썼다는 말도 덧붙였다. Harvey의 응용 연구 책임자 Niko Grupen은 Astra가 문서와 확립된 기록을 구분하고, 근거 없는 가정을 드러내며, 빈틈을 구체적인 초안 작성 방향으로 바꾸는 방식으로 법률 업무에 접근했다고 평가했다.
코딩
| 평가 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.7% | 37.3% | 55.8% | 52.3% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 73.7% |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 50.9% | 53.4% |
| 내부 데이터베이스 마이그레이션 과제 | 63.9% | 42.7% | 57.8% |
Terminal-Bench 4.0 점수는 본문 설명에서 57.9%로, 문서 하단의 표에서는 57.7%로 적혀 있다. 두 수치 모두 GPT-5.6 Sol의 37.3%보다 20%포인트 이상 높다.
기능 쪽에서는 컨텍스트 관리가 크게 바뀌었다. 지금까지 모델은 컨텍스트 창이 차면 작업 내용을 압축해 요약했다. 이 과정에서 어떤 수정이 왜 실패했는지, 어떤 구성 요소가 어떻게 동작하는지 같은 세부가 빠졌다. Astra는 Codex에서 컨텍스트 창을 넘겨 메모를 유지하고, 앞선 창의 내용도 검색할 수 있게 남긴다. 메모에 담기지 않은 요구사항이나 테스트 결과도 이전 메시지와 도구 출력에서 다시 찾을 수 있다는 설명이다. 현재는 설정 파일 config.toml에서 켜는 실험 기능이다. 몇 주 안에 Astra의 기본값이 된다.
Jane Street의 John Crepezzi는 Astra가 사내 코딩 벤치마크에서 최고 성능을 냈다고 말했다. 트레이딩 직관 평가에서도 GPT-5.6 Sol보다 뚜렷이 나아졌다고 했다. 에이전트 방식으로 쓸 때는 개발자가 작업을 따라가기 쉽게 소통하고, 프로덕션 품질에 이르기까지 반복이 덜 필요한 코드를 만든다고 평가했다.
과학과 수학
Terminal-Bench Science 0.1은 코드와 터미널 도구로 과학 연구 작업 흐름을 수행하는 능력을 평가한다. Astra는 64.6%로 Claude Fable 5.1의 52.6%를 앞섰다. 추정 API 비용은 약 31% 낮았다. 비용을 낮춘 설정에서도 61.1%를 얻어 GPT-5.6 Sol의 최고 기록 22.4%를 크게 넘었다. 대학원 수준의 과학 추론을 평가하는 GPQA Diamond에서는 96.0%를 기록했다.

소수 간격에 관한 결과 두 건도 함께 공개했다.
- 소수 쌍의 간격 상한: 십여 년 동안 알려진 최선의 결과는 무한히 많은 소수 쌍 사이의 간격이 246 이하라는 것이었다. Julia Stadlmann이 최근 이 값을 240으로 개선했다. Astra는 이 간격을 186까지 낮춘 더 강한 결과를 세우는 데 기여했다.
- 큰 소수 간격: 80년 넘게 그대로였던 상한식의 한 항을 Astra가 개선했다.
OpenAI는 두 결과의 증명과 축약한 추론 과정, 검증 자료를 함께 공개했다. EpochAI의 Greg Burnham은 이 일을 “한 시대의 끝이자 다른 시대의 시작"이라는 한 줄로 요약했다.
사이버보안
Astra가 Preparedness Framework의 사이버보안 Critical 임계를 충족한 첫 모델이라는 판정은 일주일 전 안전 공지에서 이미 나왔다. 이번 출시 공지에는 그 판정의 근거가 되는 수치가 정리되어 있다.
| 평가 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100.0% | 78.5% |
| ExploitGym | 42.4% | 30.3% |
| ExploitBench (2026년 6월부터 8월까지) | 39.0% | 5.5% |
| SRE-Bench (1회 시도) | 88.0% | 55.9% |
| SEC-Bench Pro | 85.4% | 79.1% |

과거 취약점이 벤치마크 수치에 영향을 줬을 가능성을 우려해, OpenAI는 새 평가 두 개를 만들었다. 그중 하나는 직전 3개월의 취약점으로 구성한 사내 평가다. 13개 Chrome 안정 릴리스에 걸친 고심각도 V8 취약점 20건이 들어 있다. Astra는 이 데이터셋에서 GPT-5.6 Sol보다 임의 코드 실행률이 크게 높았고, 출력 토큰은 훨씬 적게 썼다. 평가 도중에는 알려지지 않은 제로데이 두 건을 스스로 찾아내 사용했다. OpenAI는 두 취약점을 유지보수자에게 공개하는 절차를 밟고 있다.
다른 하나는 원본 소스 코드 없이 바이너리를 역공학해 핵심 로직을 파악하는 SRE-Bench다. Astra는 한 번의 시도로 88.0%, 네 번 시도 안에 99.2%를 풀었다. GPT-5.6 Sol은 각각 55.9%와 68.7%였다.
전문가 평가에서는 프로덕션 안전장치를 끈 Astra가 알려지지 않은 취약점을 이용해, 보안을 강화한 브라우저에서 임의 코드를 실행했다. 보안을 강화한 운영체제에서는 권한 상승 익스플로잇을 만들어 냈다.
이번에 출시되는 버전에서 방어자가 할 수 있는 일은 보안 코드 검토와 패치 작성까지다. 취약점의 개념 증명 익스플로잇 제작 같은 고급 작업은 모델이 거부한다. OpenAI는 Daybreak 프로그램을 통해 몇 주에 걸쳐 접근을 넓히고 제약을 낮출 계획이다. 그렇게 되면 취약점과 개념 증명 검증, 악성코드 분석, 탐지 엔지니어링 같은 방어 작업까지 열린다.
정렬과 배포
OpenAI가 Astra를 가장 정렬된 모델이라고 부르는 근거는 주로 범위를 지키는 행동에 관한 수치다.
| 평가 (낮을수록 좋음) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| 내부 컴퓨터 사용 안전 벤치마크 | 2.4% | 22.0% | 9.5% |
| 컴퓨터 사용 안전 벤치마크에 자동 리뷰 적용 | 1.8% | 4.5% | |
| 내부 우회 시도 벤치마크 | 0.00% | 0.29% | |
| ExploitGym 허니팟 | 0.0% | 48.2% | |
| 내부 환각 벤치마크 | 4.2% | 12.2% |
공지 앞부분의 평가는 허깅페이스 침해 사건을 반영해 새로 만들었다. 어렵거나 불가능한 과제를 마주한 모델이 의도된 범위를 넘어가는지 보는 시험이다. 프로덕션 안전장치가 없는 조건에서 GPT-5.6 Sol은 승인된 표적을 벗어난 경우가 48%였다. Astra는 0%였다. 사내 평가에서 Astra는 Codex의 자동 리뷰 거부를 우회하려 시도한 적이 한 번도 없었다. 자동 리뷰를 일부러 우회 가능하게 설정하고 그 방법 말고는 과제를 끝낼 수 없게 만든 조건에서도 그랬다.
자기 능력을 설명하는 방식도 개선됐다고 회사는 밝혔다. 한 평가에서 Astra는 자기 능력과 가용 수단을 부정확하게 표현하는 빈도가 GPT-5.6 Sol의 3분의 1 수준이었다.
OpenAI는 같은 절에서 후퇴한 항목도 함께 밝혔다. 감시를 회피하도록 명시적으로 지시한 시험에서, Astra가 글로 남긴 추론은 GPT-5.6 Sol의 것보다 감시하기 어려웠다. OpenAI는 원인을 두 가지로 본다. Astra가 간단한 과제에서 추론 서술을 더 많이 통제할 수 있게 됐고, 더 적은 서술 단계로 문제를 풀 수 있게 됐기 때문이다. 복잡한 과제에 필요한 추론은 여전히 숨기기 어려워 보이지만, 이 하락을 심각하게 받아들인다고 회사는 덧붙였다.
배포 단계에서는 Codex 자동 리뷰와 함께, Astra급 모델이 정렬에서 벗어난 행동을 하는지 감시하는 장치가 프로덕션에 들어간다. 분류기가 모델의 추론과 행동을 검사해 승인되지 않은 활동을 자동으로 멈춘다. 사이버 능력이 크게 오른 만큼 추가 안전 점검이 정당한 작업을 늦추거나 멈출 수 있다고 공지는 그대로 밝혔다. ChatGPT나 Codex에서 작업이 멈추면 사용자에게 검토 요청이 가고, API에서는 작업이 중단된다.
가장 눈여겨본 것
OpenAI가 세계에서 가장 지능적인 모델이라고 소개한 이 공지의 벤치마크 표에는, Astra가 1위를 내준 칸도 몇 개 있다.
| 평가 | GPT-6 Astra | 더 높은 점수 |
|---|---|---|
| Humanity’s Last Exam (도구 사용) | 57.2% | Claude Fable 5.1 65.0%, Claude Fable 5 63.8%, Claude Opus 5 63.6% |
| Artificial Analysis Intelligence Index v4.1.1 | 61.2 | Claude Fable 5.1 65.7, Claude Opus 5 63.1, Claude Fable 5 62.1 |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | Claude Opus 5 68.1, Claude Fable 5 67.2 |
| FrontierCode 1.1 Main | 53.3% | Claude Fable 5 53.5%, Claude Opus 5 53.4% |

종합 지능 지수와 종합 코딩 지수, 도구를 쓰는 인류 최후의 시험에서 Astra는 경쟁 모델에 뒤진다. 그러면서 컴퓨터 사용과 터미널 작업, 사이버보안, 수학에서는 큰 격차로 앞선다. 프런티어라는 말이 지금 어느 능력을 두고 쓰이는지는 이 대비를 보면 알 수 있다.
감시 가능성이 낮아졌다는 문구를 출시 공지에 함께 쓴 일도 흔하지 않다. 능력이 오르면서 모델이 더 적은 추론 단계로 문제를 풀고, 추론을 서술하는 방식도 더 잘 통제하게 됐다는 설명이다. 그래서 밖에서 들여다보기가 어려워졌다. OpenAI는 성능을 내세우는 문단들 사이에 자기에게 불리한 결과를 함께 적었다. 나는 이 공지에서 그 대목이 가장 많은 것을 알려 준다고 본다.
출처
OpenAI, “GPT-6 Astra: A new generation of intelligence”, 2026년 9월 3일 원문: https://openai.com/index/gpt-6-astra/
관련 자료
- 안전 공지: https://openai.com/index/path-to-astra/ (다이제스트: Path to Astra)
- 시스템 카드: https://deploymentsafety.openai.com/gpt-6-astra
삽화는 「느낌적인 느낌을 숫자로 옮기는 일」의 치비 서소영 라인아트를 참조하여 gpt-image-2 image-to-image로 생성했다.
