3줄 요약

  1. Epoch AI가 운영하는 FrontierMath는 벤치마크 하나로 출발했다가 지금은 세 갈래 프로그램으로 커졌다. 답이 정해진 문제 338개를 모은 Tiers 1-4, 아직 아무도 풀지 못한 연구 문제 50개를 모은 Open Problems, 에르되시 문제 68개를 Lean으로 형식화한 FrontierMath Erdős로 나뉜다.
  2. 세 갈래의 성적표가 크게 갈린다. GPT-6 Astra는 Tiers 1-3에서 93.7%를 받았고 가장 어렵다는 Tier 4에서도 90%대를 기록했지만, 에르되시 68문제에서는 두 문제만 풀어 3%에 머물렀다. 같이 시험한 네 모델은 한 문제도 풀지 못했다.
  3. Epoch는 문제 선정 기준과 검증 절차와 실행 예산을 모두 공개해서, AI가 의미 있는 수학 난제를 얼마나 자주 푸는지에 분모를 붙이려 한다. 초기 결과를 보면, 그런 성과가 실제로 있기는 하지만 아직 드물다.

한 이름 아래 세 갈래

FrontierMath는 원래 닫힌 형태의 답을 가진 문제를 모은 벤치마크 하나였다. 지금은 성격이 다른 세 부분으로 갈라져 있고, Epoch는 이 셋을 묶어 고등 수학에서 AI를 시험하는 프로그램이라고 부른다.

구성문제 수답의 형태검증 방법
FrontierMath Tiers 1-4338문제 (Tiers 1-3이 295, Tier 4가 43)닫힌 형태의 수식이나 값모델이 제출한 파이썬 함수를 실행해 정답과 대조
FrontierMath: Open Problems미해결 연구 문제 50개구체적으로 지정된 수학적 대상문제마다 따로 만든 전용 검증 프로그램
FrontierMath Erdős에르되시 명제 68개 (문제 65개)Lean 4로 쓴 증명 또는 반증Lean FRO의 증명 검사기 Comparator

Tiers 1-4는 OpenAI의 자금 지원으로 만들어졌고 OpenAI가 일부 문제에 독점 접근권을 갖는다. Open Problems는 Schmidt Sciences의 지원을 받았고 소유권은 Epoch에 있다.

Tiers 1-4: 답이 정해져 있는 문제

이 벤치마크는 수학자들이 직접 출제한 미공개 문제 350개로 시작했다. 문제의 난이도는 대학 학부 수준부터 전문 연구자가 며칠을 들여야 하는 수준까지 네 단계로 나뉜다. Tier 4의 50문제는 수학과 교수와 박사후연구원이 단기 연구 과제 형태로 만들었다.

문제가 갖춰야 할 조건은 세 가지다.

  1. 확정적이고 검증 가능한 답: 큰 정수, 기호로 표현된 실수, 또는 그런 값들의 튜플처럼 계산으로 확인할 수 있는 답이어야 한다.
  2. 찍기 방지: 무작위 시도나 단순 완전 탐색으로 맞힐 확률이 무시할 만큼 작아야 한다.
  3. 계산 가능성: 계산량이 많은 문제라면 표준 지식에서 출발해 답에 이르는 스크립트를 함께 내야 하고, 그 스크립트의 실행 시간은 보통 하드웨어에서 모두 합쳐 1분 안이어야 한다.

출제에 참여한 버지니아 대학의 켄 오노 교수는 이렇게 말했다.

AI를 막아 세울 만한 문제가 무엇일지, 우리 나름의 최선의 추측으로 문제를 설계했다. 내 전공 분야 문제 중에도 내가 겨우 푸는 것이 있다. AI가 하나도 못 맞히기를 바란다. 0점을 받았으면 한다.

2026년 6월 12일 Epoch는 v2를 내면서 전체 문제의 42%에서 발견된 오류를 손봤다. Tiers 1-3에서 123문제, Tier 4에서 12문제를 고쳤고, 각각 5문제와 7문제를 뺐다. 그렇게 남은 338문제가 지금의 데이터셋이고, 이 중 12문제만 공개돼 있다.

평가 환경은 모델에게 꽤 너그럽다. 모델은 파이썬 도구로 코드를 돌려 가설을 시험한다. 마지막에는 답을 돌려주는 answer 함수를 제출한다. 토큰 상한은 100만이고, 66만 토큰에 이르면 다음 메시지에서 제출을 강제한다. 채점할 때 답 함수의 실행 시간은 30초까지 허용한다.

Epoch는 인간 기준선을 MIT에서 연 대회로 쟀다. 참가자는 뛰어난 수학 전공 학부생과 해당 분야 전문가 40여 명이었다. 이들은 네다섯 명씩 여덟 팀을 이뤄, 인터넷을 쓰면서 네 시간 반 동안 Tiers 1-3에서 뽑은 23문제에 도전했다. 팀 평균 점수는 19%였고, 여덟 팀이 푼 문제를 모두 합쳐도 35%였다.

Epoch가 공개하는 실행 기록 파일에서 v2 비공개 세트 성적을 뽑으면 아래와 같다. 2026년 9월 11일에 내려받은 값이다.

모델Tiers 1-3 (v2)Tier 4 (v2)
GPT-6 Astra93.7%82.9%에서 97.6% (6회 실행)
Claude Fable 5.190.2%87.8%
GPT-5.6 Sol89.1%80.5%와 82.9% (2회 실행)
Claude Fable 587.0%90.2%
GPT-5.5 Pro87.7%78.0%

연구자가 몇 시간에서 며칠을 들여야 하는 Tier 4에서도 상위 모델은 이미 90% 언저리에 올라 있다.

Open Problems: 답이 없는 문제 50개

FrontierMath: Open Problems 커버. 청록 바탕에 매듭처럼 얽힌 선이 그려져 있다

두 번째 구성은 성격이 완전히 다르다. 여기 실린 50문제는 아직 아무도 풀지 못했고, 전문 수학자들이 진지하게 달려들었다가 물러난 문제들이다. AI가 하나를 풀면 그만큼 인류의 수학 지식이 늘어나는 셈이다.

Epoch는 답을 모르는 채로 채점할 방법을 먼저 마련했다. 해답은 모르더라도 제출된 해법이 맞는지는 확인할 수 있는 문제만 고른 것이다. 문제마다 전용 검증 프로그램을 만들어 두고, 제출된 대상이 요구 조건을 만족하는지 기계가 확인한다. 조건에 맞는 대상을 찾기는 어렵다. 반면 찾아낸 대상이 맞는지는 쉽게 확인할 수 있다. 이런 구성적인 문제만 들어온다는 뜻이다. Epoch도 이 제약이 편향을 낳는다고 인정한다. 수록 문제는 조합론과 정수론 쪽으로 기울어 있다.

문제의 중요도는 네 등급으로 나뉜다.

등급기준
Moderately Interesting10년 전부터 제기됐고 독립된 두 팀 이상이 매달렸던 문제. 더 큰 물음과 이어져 있지만 대형 연구 프로그램의 우선순위는 아니다
Solid Result그 분야의 유능한 연구자가 자신의 평균적인 논문에서 이 정도 문제를 다뤘다면 만족할 수준
Major Advance정수론이나 그래프 이론 정도로 넓은 분야에서 일하는 사람이라면 주목하고, 해법의 개요 정도는 시간을 내 이해하려 할 수준
Breakthrough전공이 달라도 알고 싶어 할 결과. 그해 수학 전체에서 최고 성과 후보에 오를 만한 수준

등급 판정과 문제 선별은 편집위원회가 맡는다. 위원은 토머스 블룸, 대니얼 리트, 댄 로믹 세 사람이다.

시험 방식은 Tiers 1-4보다 훨씬 넉넉하다. 모델에게는 파이썬 도구, 명령줄, 웹 검색을 준다. 표본 하나당 출력 토큰 100만을 허용하고, 문제마다 네 번씩 돌린다. 어떤 문제가 풀리면 그 문제는 벤치마크에서 빠진다. 이후에 같은 문제를 푸는 것은 새로운 발견이 아니기 때문이다. 그래서 이 벤치마크는 시스템별 백분율 점수를 내지 않는다.

Epoch는 수록 문제 중 상당수가 애초에 풀리지 않을 것이라고 본다. 문제별 대략적 추정을 모아 보니, 그 비율이 적어도 10%는 되고 많아야 40%에는 못 미칠 것이라고 한다. 기계로 확인할 수 있는 방향이 한쪽뿐인 문제가 많고, 조건에 맞는 대상이 있더라도 너무 커서 확인하지 못할 수 있기 때문이다.

검증 프로그램에 대한 접근권은 누구에게나 판매한다. 수익은 벤치마크를 키우는 데 쓰인다. 2026년 7월 출범 시점 기준으로 실제로 구매한 곳은 OpenAI 한 곳뿐이다.

문제 목록에는 지금 50문제가 올라 있고, 그중 여섯 문제에 AI 해결 표시가, 한 문제에 사람 해결 표시가 붙어 있다.

문제상태
종수 2 곡선 위의 많은 유리점Solved (AI)
계수가 큰 유리수체 위의 타원곡선Solved (AI)
668차 아다마르 행렬Solved (AI)
소수 위수 31 이상의 유리 비틀림점을 갖는 종수 2 곡선Solved (AI)
8, 9, 10에 대한 짧은 초순열Solved (AI)
2진체의 절대 갈루아 군의 표시(presentation)Solved (AI)
마티외 군 M23에 대한 역 갈루아 문제Solved (human)

668차 아다마르 행렬, 그리고 누가 풀었다고 볼 것인가

아다마르 행렬은 각 성분이 +1 또는 -1이고, 행끼리 직교하는 정사각 행렬이다. 자명한 경우를 빼면 그 크기는 4의 배수여야 하는데, 그런 크기마다 항상 아다마르 행렬이 존재한다는 것이 아다마르 추측이고 아직 미해결이다. 수학자들은 알려진 사례의 크기를 조금씩 키워 왔다. 그 전까지 가장 작은 미해결 사례였던 428차는 2004년 카라가니(Kharaghani)와 타이페레자이(Tayfeh-Rezaie)가 해결했고, 그다음으로 작은 미해결 사례가 668차였다.

2026년 8월 12일 Epoch는 이 문제를 AI 해결로 표시했다. Anthropic의 한 연구자는 사람 셋과 Claude로 이뤄진 팀의 성과라고 밝히며 결과를 공개했다. 퍼즐 형태로 내놓은 그 답에는 2000 이하의 허용 크기 중 사례가 알려지지 않았던 경우가 모두 들어 있었고, 668차도 그중 하나였다. Epoch는 이 판정이 잠정적이라고 적어 뒀다. 이후 보고에서 핵심 수학 아이디어에 사람의 기여가 컸다고 드러나면 판정을 바꾸겠다고 한다.

하루 전인 8월 11일에는 반대 방향의 판정이 있었다. 마티외 군 M23에 대한 역 갈루아 문제가 황(Huang) 등이 낸 논문으로 해결되자 Epoch는 이를 사람 해결로 분류했다. 기준은 핵심 아이디어를 AI가 냈다는 점이 명백해야 한다는 것이다. 한 저자는 사람이 기여한 추론과 AI가 기여한 추론의 경계가 분명하지 않으며, 선을 긋기란 실질적으로 불가능할 것이라고 말했다. 다른 저자는 회고에서 가장 중요한 결정 몇 가지는 분명히 사람 협력자가 내린 수학적 판단이었다고 적었다. Epoch는 이를 AI 기여가 명백하지 않다는 뜻으로 읽었다.

FrontierMath Erdős: 증명까지 형식화해야 한다

FrontierMath Erdős 커버. 짙은 남색 바탕에 점선으로 그린 방사형 꽃 문양이 놓여 있다

세 번째 구성은 2026년 9월 1일에 공개됐다. 톰 아담체프스키와 그레그 버넘이 쓴 공지에 따르면, 에르되시 문제는 올해 AI 수학 성과를 재는 관행상의 기준처럼 쓰여 왔다. 그러나 그 지위는 상당히 비공식적이었다. 이 벤치마크는 거기에 세 가지를 보탠다.

선별. 에르되시 문제라는 이름은 균일해 보이지만 실제로는 중요도와 난이도가 천차만별이다. 블룸이 운영하는 erdosproblems.com에는 1217문제가 실려 있고 그중 652문제가 미해결이다. Epoch는 블룸에게 그중 자기가 보기에 특히 중요하고 어려운 문제를 골라 달라고 부탁했고, 그렇게 68개가 뽑혔다. 미해결 문제의 약 10%다. 블룸은 이 급의 에르되시 문제 중 그때까지 AI가 푼 것이 3개에서 5개 정도라고 어림했다.

검증. 68개 명제 중 50개는 구글 딥마인드가 관리하는 오픈소스 라이브러리 Formal Conjectures에서 가져왔다. 나머지는 Epoch가 자동 형식화 파이프라인으로 만들었고, 블룸이 원래 문제를 충실히 옮겼는지 하나씩 검토했다. 제출된 증명은 Lean FRO가 만든 검사기 Comparator가 확인한다. 시도마다 컨테이너를 두 개 쓴다. 모델이 작업하는 쪽과, Lean 도구만 깨끗하게 설치된 검사 쪽이 분리돼 있고, 둘 다 인터넷에 연결되지 않는다.

재현. 지금까지 가장 인상적인 에르되시 문제 해결 사례는 AI 기업 내부에서 나왔고, 어떤 모델을 어떤 뼈대에 얹어 추론 비용을 얼마나 썼는지는 거의 공개되지 않았다. Epoch는 전체 코드와 68문제 목록을 공개했다.

에이전트가 쓰는 컨테이너에는 Mathlib을 갖춘 Lean 4와 컴퓨터 대수 시스템 SageMath가 들어 있다. 파이썬에는 sympy, mpmath, numpy, pantograph가 함께 깔려 있다. 네트워크가 없는 대신 2022년까지 나온 순수수학 arXiv 논문 47만 6천 편의 LaTeX 원본을 오프라인 사본으로 넣어 준다. 시도는 문제당 한 번이고, 한 번의 시도는 비용 300달러 또는 작업 시간 72시간에서 끊긴다.

첫 실행 결과는 이렇다.

모델점수
GPT-6 Astra3%
GPT-5.6 Sol0%
GPT-5.50%
Claude Fable 5.10%
Claude Fable 50%

문제를 푼 모델은 GPT-6 Astra 하나뿐이었다. 이 모델이 68문제 중 2문제를 풀었다. 74번 문제는 반례를 찾아 반증했는데 218달러와 작업 시간 15시간이 들었고, 126번 문제는 증명해서 247달러와 16시간이 들었다. 나머지 시도와 다른 네 모델의 모든 시도는 예산을 다 쓰고도 검증을 통과하는 증명을 내놓지 못했다.

Epoch는 벤치마크 실행과 별개로, 예산을 늘리고 에이전트 설정을 바꿔 가며 같은 문제들에 여러 번 더 도전했다. 이 추가 시도는 점수에 반영하지 않는다고 공지에 분명히 밝혀 뒀다. 프로토콜이 다르기 때문이다. 그렇게 해서 Astra가 한 번이라도 푼 문제는 다섯 개(1번, 74번, 126번, 548번, 571번)로 늘었다.

문제결과성공 횟수성공한 시도의 비용
1번반증4회 중 2회405달러, 1,384달러
74번반증6회 중 6회47달러에서 271달러
126번증명4회 중 4회154달러에서 249달러
548번증명3회 중 1회363달러
571번증명3회 중 1회617달러

나머지 문제들은 대체로 두 번에서 다섯 번씩, 모두 172회를 시도했지만 하나도 풀리지 않았다. 이 다섯 개를 얻기까지 들어간 계산 비용이 22만 달러가 넘는다. 정식 벤치마크 실행 한 차례에 든 비용은 약 2만 달러였다.

세 성적표를 나란히 놓으면

한 기관이 한 모델을 놓고 매긴 성적인데, 어느 시험이었느냐에 따라 아래처럼 벌어진다.

시험문제 성격최고 성적
Tiers 1-3 (v2)답이 정해진 문제GPT-6 Astra 93.7%
Tier 4 (v2)연구 수준이되 답이 정해진 문제GPT-6 Astra 최대 97.6%
Open Problems미해결 연구 문제 50개AI 해결 표시 6문제
FrontierMath Erdős미해결 문제 68개, Lean 증명까지GPT-6 Astra 3% (2문제)

Epoch가 공지 말미에 내린 결론도 이 대비를 그대로 옮긴 것이다. 이 뼈대와 이 예산에서 Astra는 중요한 미해결 문제 목록의 약 3%를 풀었다. AI가 그런 급의 문제를 푼다는 것 자체는 놀랍다. 그러나 문제를 아무거나 하나 집었을 때 AI가 그것을 풀 확률은 아직 높지 않다.

가장 눈여겨본 지점

세 벤치마크를 견주다 보면 형식 증명이 얼마나 큰 짐을 얹는지 알 수 있다. 공지에는 이런 사례가 실려 있다. OpenAI 모델이 에르되시 단위 거리 추측(블룸 사이트 90번)의 해법을 내놨을 때, 자연어 증명은 18쪽이었다. 그것을 Lean으로 옮긴 후속 작업의 결과물은 120만 줄이었다. 논문이라면 알려진 깊은 정리를 그대로 인용하고 한 줄로 넘어갈 수 있다. 형식 증명은 Lean 표준 라이브러리에 그 정리가 없으면 밑바닥부터 다시 세워야 한다.

그렇다면 에르되시 벤치마크의 3%가 무엇을 잰 값인지도 다시 봐야 한다. 이 숫자에는 수학 능력과 형식화 능력이 함께 들어가 있다. 문제당 300달러와 72시간이라는 제한도 같이 들어가 있다. Epoch도 이 한계를 그대로 적어 뒀다. Open Problems 쪽은 아예 Lean을 쓰지 않기로 했는데, 수학 능력과 형식화 능력을 떼어 놓고 재고 싶었다는 것이 이유 중 하나였다. Epoch는 비슷한 시기에 만든 두 벤치마크에서 이 지점만 정반대로 정한 셈이다. 덕분에 두 숫자를 나란히 읽으면 형식화에 붙는 값이 얼마쯤인지 짐작할 수 있다.

내가 오래 들여다본 또 하나는 668차 아다마르 행렬과 M23 판정의 대비다. 한쪽은 사람 셋과 Claude가 함께 낸 결과인데 잠정적으로 AI 해결이 됐고, 다른 쪽은 사람과 AI가 함께 낸 결과인데 사람 해결이 됐다. 두 판정을 가른 기준은 저자들이 논문과 회고에 남긴 진술이었다. AI의 기여도를 재는 일에는 아직 전용 계측기가 없다. 지금은 함께 일한 사람이 무엇을 말하느냐가 그 자리를 대신하고 있다.

출처

Epoch AI, “FrontierMath: Benchmarking AI against advanced mathematical research”, 프로그램 페이지와 하위 문서들. 원문: https://epoch.ai/frontiermath

함께 참조한 페이지는 다음과 같다.

본문에 실은 이미지 세 장은 Epoch AI의 FrontierMath 페이지에 걸린 배너를 그대로 인용했다.