
FrontierMath: Benchmarking AI against advanced mathematical research
Epoch AI의 수학 벤치마크 프로그램이 세 갈래로 갈라졌다. 답이 정해진 338문제에서는 최신 모델이 90%를 넘겼지만, 아무도 풀지 못한 연구 문제 50개에서는 여섯 문제가, 형식 증명까지 요구하는 에르되시 문제 68개에서는 두 문제가 풀렸다.

Epoch AI의 수학 벤치마크 프로그램이 세 갈래로 갈라졌다. 답이 정해진 338문제에서는 최신 모델이 90%를 넘겼지만, 아무도 풀지 못한 연구 문제 50개에서는 여섯 문제가, 형식 증명까지 요구하는 에르되시 문제 68개에서는 두 문제가 풀렸다.