3줄 요약

  1. 하버드 대학교의 이론물리학자 매슈 슈워츠(Matthew Schwartz)가 2026년 10월 1일 Anthropic 연구 블로그에 글을 기고했다. 그는 Claude를 사람 과학자처럼 일하게 하려던 시도를 그만두고, 현재 세대 언어 모델의 능력에 가장 잘 맞는 ‘Claude 모양(Claude-shaped)’ 문제를 Claude가 직접 찾게 했다.
  2. 그 과정에서 정량 과학의 정확한 계산을 위한 오픈소스 하네스 BootLoops가 만들어졌다. 슈워츠는 석 달 동안 18개 분야에서 공저자 19명과 함께 원고 36편을 썼다. Claude는 타원 파인만 적분 30개를 부트스트랩 방법으로 처음부터 끝까지 계산했고, 그중 15개는 이전에 아무도 계산하지 못한 적분이다. 같은 방식으로 생태학, 집단유전학, 경제학, 언어학에서도 결과가 나왔다.
  3. Claude가 다른 분야에서 낸 결과는 대부분 기술적으로 옳았지만, 처음에는 과학적으로 눈에 띄지 않았다. 그 분야 전문가가 연구 질문을 바꿔 준 뒤에야 의미 있는 과학이 됐다. 슈워츠는 AI가 연구 속도를 크게 높이겠지만 과학적 방법론을 다시 검토할 근거는 없다고 보았다. 그는 개념을 세우는 일과 무엇이 흥미로운지 판단하는 일은 여전히 사람이 맡아야 한다고 썼다.

과학자가 원하는 일과 AI가 잘하는 일

에이전트형 AI는 빠르게 좋아지고 있다. 모델은 아는 것이 많아지고, 실수가 줄고, 더 나은 아이디어를 낸다. 그런데 학계 과학자들이 이 모델을 자기 연구에 직접 써 보면 기대와 다른 경험을 하는 경우가 많다. 모델이 어렵고 오래된 문제를 풀었다는 소식은 계속 나오지만,1 대부분은 기존 기법을 범위가 잘 정해진 문제에 적용한 사례였다. 화제가 된 성과도 주로 수학에서 나왔다. 수학은 문제를 완전히 서술할 수 있고 답이 맞는지 확실하게 검증할 수 있는 거의 유일한 과학 분야인데, 과학의 나머지 분야는 대부분 그렇지 않다. 슈워츠는 이런 소식과 실제로 모델을 써 본 경험 사이의 차이 때문에 많은 연구자와 학생이 좌절하고 불안해한다고 적었다.

슈워츠의 진단에 따르면, 지금의 언어 모델은 뛰어나지만 사람 과학자처럼 일하는 것이 이 모델들이 가장 잘하는 일은 아니다. Claude와 GPT는 과학을 잘하지만 과학자는 아니어서, 과학적으로 가치 있는 결과를 내도록 하려면 사람이 과정의 많은 부분을 직접 지도해야 한다. 물리학자라면 이것을 ‘임피던스 불일치’(impedance mismatch)라고 부를 것이라고 그는 썼다. 각각은 잘 작동하는데 서로 맞지 않는 두 시스템에서, 한쪽이 입력한 것의 대부분이 다른 쪽에 전달되지 않는 상태를 가리키는 말이다. 이 경우에는 과학자가 원하는 일과 AI가 잘하는 일이 서로 맞지 않는다.

이 문제를 풀기 위해 슈워츠는 불일치가 덜한 사례를 찾기 시작했다. 먼저 Claude에게 수리물리학 도구 모음을 만들게 했는데, 얼마 지나지 않아 그 도구가 다른 문제에도 쓰였다. 이 과정을 반복하자 소프트웨어와 과학 연구 절차의 묶음이 생겼고, 그는 이것에 BootLoops라는 이름을 붙였다. Claude Code나 Claude Science가 Claude의 하네스이고 Codex가 GPT의 하네스인 것처럼, BootLoops도 언어 모델의 하네스 역할을 한다. BootLoops는 오픈소스이고, 어떤 모델과도 함께 쓸 수 있다.

BootLoops를 갖춘 Claude는 같은 패턴을 거듭 발견했다. 여러 분야에, 수학이나 물리학이나 컴퓨터 과학의 기법 하나만 알면 곧바로 풀리는 문제들이 있었던 것이다. 슈워츠는 이런 문제를 ‘Claude 모양 문제’라고 부르기 시작했다. 그리고 본업인 고에너지 이론물리학 외에도 지질학, 생물학, 경제학, 언어학의 문제까지 연구 범위를 확장했다. 이 분야들에서는 Claude가 찾은 것이 흥미로운지 스스로 판단할 수 없었기 때문에, 그는 전문가들을 찾아가 의견을 구했다.

산란 진폭에서 타원 적분까지

슈워츠는 2025년 12월에 Claude를 연구 조수로 써 보았고, 그 경험을 「Vibe Physics」라는 글로 정리했다.2 그때 Claude Opus 4.5는 20배 빠른 우수한 대학원생처럼 일했다. 실험 끝에 질 좋은 논문이 나왔지만 과정은 고됐다. 그는 Claude가 쓴 문장을 하나하나 고쳐야 했고, 관련 없는 주제에 시간을 쓰지 못하게 막아야 했고, 성과가 나지 않을 연구는 중단시켜야 했다.

올해 여름에는 접근 방식을 바꿨다. Claude를 자기가 바라는 협력자로 대하려던 생각을 그만두고, Claude가 실제로 어떤 협력자인지를 기준으로 일을 맡기기로 한 것이다. 그러려면 Claude의 강점에 맞는 문제를 찾아야 했다. 슈워츠가 보기에 지금의 Claude는 깊은 개념적 질문에는 도움이 되지 못한다. 대신 Claude는 모든 분야에 걸친 거의 무한한 지식, 뛰어난 코딩 실력, 수학과 통계의 최신 지식, 그리고 논문과 부록과 데이터를 기계의 속도로 읽어 내는 능력을 갖췄다.

Claude 모양 문제를 처음 찾아보기에 적당한 분야는 코딩이 도움이 되는 분야였다. Anthropic이 2026년 여름 Claude Fable 5를 출시하자, 슈워츠는 이 모델의 사이버 보안 능력이 과학 계산에서도 통하는지 확인하고 싶어졌다. 그는 시험 삼아 자기 논문 몇 편과 산란 진폭(scattering amplitude) 관련 문헌에 나온 여러 방법을 Fable 5에게 이식하고, 코드로 구현하고, 개선하게 했다.

산란 진폭은 대형 강입자 충돌기(LHC)의 데이터를 해석하는 데 쓰인다. 양성자 두 개를 13조 전자볼트로 충돌시키면 많은 잔해가 흩어져 나온다. 산란 진폭은 이 잔해를 측정한 값에서 충돌 때 만들어진 입자(힉스 보손이나 아직 알려지지 않은 입자)를 추론하게 해 주는 이론적 계산이다. 이 계산에는 파인만 도형이 쓰이고, 도형 하나가 특정한 형태의 다차원 적분 하나에 대응한다. 지금 물리학자들이 씨름하는 적분은 하나를 계산하는 데 박사 논문 한 편이 들거나, 연구 그룹 하나가 몇 년을 매달려야 할 만큼 어렵다.

지난 20년 동안 적분을 직접 계산하는 방식을 대신할 방법으로 S행렬 부트스트랩이 발전했다. 부트스트랩은 적분을 계산하지 않고, 답이 될 수 있는 후보가 하나만 남을 때까지 물리적 제약 조건을 차례로 적용한다. 원문은 이런 예를 들었다.

  1. 진폭이 무한대가 되는 지점, 곧 특이점(singularity)을 알면 후보가 2만 개 정도로 줄어들 수 있다.
  2. 대칭성을 적용하면 후보가 500개로 줄어든다.
  3. 이런 식으로 제약을 더해 후보를 하나로 줄인다.

전통적인 부트스트랩은 순수하게 해석적인 방법이고, 제약 조건만으로 답이 하나로 정해지는 가장 대칭적인 이론에서 가장 많은 성과를 냈다. N=4 초대칭 양-밀스 이론의 9루프 진폭이 그런 예다.3 하지만 현실 세계에 가까운 이론에서는 답이 하나로 정해지기 전에 적용할 제약 조건이 더 이상 없는 경우가 많다. 최근 등장한 준수치 부트스트랩(semi-numerical bootstrap)은 이렇게 모자라는 제약 조건을 수치 계산으로 보완한다.4 진폭을 몇몇 점에서 엄청난 정밀도(때로는 1,000자리)로 계산할 수 있고 남은 후보가 충분히 적다면, 그 수치로 나머지 계수를 정확히 정할 수 있다.

슈워츠는 준수치 부트스트랩이 에이전트형 AI에 이상적인 문제라고 판단했고, 그 이유로 세 가지를 들었다.

  • 한 사람이 모두 익히기 어려운 수학, 물리학, 컴퓨터 과학 지식이 함께 필요하다.
  • 코딩과 알고리즘 개발이 많이 필요하다.
  • 결과를 검증할 수 있다. 같은 수치 계산을 이용하면 전문가든 아니든 누구나 스크립트 두 개를 실행해서, 최종 답을 원래 적분과 원하는 자릿수까지 비교할 수 있다.

또 이 분야의 전문 지식은 고르게 공유되어 있지 않다. 좋은 아이디어가 Wolfram 언어, C++, 파이썬, 줄리아 등 여러 언어로 구현되어 있고, 코드 없이 논문으로만 발표된 아이디어는 그보다 더 많다. 그래서 Fable 5가 맡은 첫 과제는 이 아이디어들을 모두 하나의 공통 프레임워크로 이식하고, 논문에 코드가 딸려 있지 않은 아이디어는 코드를 직접 작성하는 일이었다.

Claude는 이 일을 손쉽게 해냈다. 슈워츠가 몇 주 동안 코드를 짜서 얻은 자기 논문의 결과를, Claude는 20분쯤 만에 재현했다. 그는 이 속도에 놀랐다. 그러나 Claude가 슈워츠의 방식은 매우 비효율적이고 그가 모르던 더 나은 알고리즘이 있다고 알려 준 데에는 놀라지 않았다고 한다.

다음으로 슈워츠는 아직 결과가 알려지지 않았지만 계산은 할 수 있는 진폭을 Claude에게 찾게 했다. 알고 보니 S행렬 부트스트랩으로 풀 수 있을 만큼 단순한 문제는 사람도 풀 수 있을 만큼 단순했고, 실제로 대부분 이미 답이 나와 있었다. 그래도 Claude는 답이 없는 문제를 몇 개 찾아냈다. 모델과 이야기를 나눠 보니 Claude는 가장 단순한 함수족인 로그 함수로 표현되는 진폭만 다루고 있었다. 슈워츠는 그다음으로 단순한 함수족인 타원 함수로도 같은 일을 할 수 있는지 물었다.

타원 적분은 적분 계산에 많은 시간을 쓰는 슈워츠 같은 사람에게도 매우 어렵다. 지금까지 계산된 타원 파인만 적분은 몇 개뿐이고, 슈워츠와 Claude가 아는 한 부트스트랩만으로 완전히 계산된 적분은 하나도 없었다. 그는 이 적분들을 기존 방법으로도 계산할 수 있지만, 필요한 전문 지식이 여러 사람에게 분산되어 있어서 아무도 시도하지 않았다고 설명했다.

반면 Claude는 로그 함수의 경우를 다루려고 이식하거나 직접 만든 도구들을 다른 종류의 적분에도 쉽게 일반화했다. 이번에는 소프트웨어의 대부분을 직접 작성했고, 나머지는 물리학이 아닌 수학 분야에서 빌려 왔다. 도구가 늘어나면서 Claude가 계산하는 적분도 하나씩 늘었고, 곧 30개의 적분을 BootLoops로 처음부터 끝까지 계산했다. 알려진 결과를 새 방법으로 다시 얻은 적분이 15개였고, 한 번도 계산된 적이 없던 적분도 15개였다.

여기까지는 몇 주밖에 걸리지 않았다. 처음에 슈워츠는 이 결과를 정리해 발표하는 것으로 만족하려 했다. 그런데 BootLoops를 갖춘 Claude와 자신이 함께 무엇을 더 할 수 있는지 보고 싶은 마음을 참을 수 없었다.

같은 방정식, 다른 분야

과학에서는 같은 방정식이 전혀 다른 맥락에서 되풀이해 등장하는 일이 많다. 물리학에서는 확산 방정식, 포커-플랑크 방정식, 슈뢰딩거 방정식이 모두 같은 수학적 형태를 가지므로, 한 문제를 푸는 방법을 개발하면 다른 많은 문제에도 적용할 수 있다. 슈워츠는 BootLoops가 잘하는 계산이 우주론이나 끈 이론에도 쓰인다는 것을 알고 있었다. 이 적분들이 집단유전학의 베이즈 증거(Bayesian evidence) 적분에 대응한다는 점, 그리고 파인만 적분을 환원할 때 쓰는 유한체(finite field) 방법을 진화생물학 문제에도 쓸 수 있다는 점은 몰랐는데, Claude가 기꺼이 알려 주었다.

이때부터 Claude 모양 문제, 좁게는 BootLoops 모양 문제를 찾아 푸는 일이 특히 활발해졌다. 일부는 처음부터 훌륭한 응용임이 분명했는데, 계통학(phylogenetics)이 그런 경우였다. 계통학은 DNA를 이용해 생물종을 계통수로 정리하는 학문이고, 여기에 필요한 계산이 베이즈 증거 적분이다. 이 적분의 결과는 후보 계통수 하나가 관측된 DNA를 얼마나 잘 설명하는지 나타내는 숫자 하나다. BootLoops가 원래 계산하려고 만든 적분과 같은 종류다.

슈워츠는 아이디어가 나올 때마다 Claude에게 기존 도구를 쓰는 동시에 새 도구도 만들라고 요구했다. 하네스의 기능을 계속 늘리기 위해서였다. 실패한 프로젝트에서 나온 도구도 다른 연구에 쓰였고, Claude가 해낼 수 있는 일은 점점 많아졌다. 그는 이를 영화 「매트릭스」에서 쿵후를 다운로드받고 깨어난 네오에 비유했다.

하지만 내 전문 분야가 아닌 프로젝트가 늘어나자 걱정이 생겼다. Claude가 내 분야에서 해낸 일이 대단하다고 주장하면, 나는 그 말이 맞는지 판단할 수 있다(맞지 않을 때가 많다). 그런데 다른 분야에서 해낸 일이 대단하다고 주장하면 나도 모르게 동의하게 된다. 의심이 커지자, 확실히 하려면 전문가를 불러야 한다는 것을 알았다. 실제로 거의 모든 경우에 Claude는 기술적으로 옳았지만, 전문가의 지도를 받기 전까지 그 결과는 그다지 흥미롭지 않았다.

생태학의 중립 이론

어떤 생태계에서든 번성하는 종이 있고 사라지는 종이 있다. 종마다 다른 이런 생활사(life history) 가운데 얼마만큼을 우연으로 설명할 수 있을까. 생태학의 중립 이론(neutral theory)은 이 질문을 다룬다. 앞선 연구를 바탕으로, 생태학자 스티븐 허벨(Stephen Hubbell)은 2001년에 어쩌면 전부가 우연일 수도 있다는 도발적인 주장을 내놓았다. 2005년에는 생태학자 람팔 에티엔(Rampal Etienne)이 허벨의 이론을 방정식으로 표현해, 적어도 원리적으로는 정밀하게 검증할 수 있게 했다. 그런데 이후 20년 동안 아무도 이 방정식을 대규모 데이터로 풀어내지 못했다.

Claude는 에티엔의 방정식이 BootLoops 모양 문제임을 알아보고 풀어냈다. 연구진이 이 계산을 데이터에 적용해 보니, 지구에서 가장 많이 연구된 숲인 파나마 운하의 바로콜로라도섬(Barro Colorado Island)에서 나무 종 구성이 중립 이론이 허용하는 것보다 4.5배 빠르게 바뀌고 있었다.

들뜬 슈워츠는 이 결과를 식물생물학 교수이자 중립 이론 전문가인 제임스 오드와이어(James O’Dwyer)에게 보여 주었다. 오드와이어는 참을성 있게 이야기를 들어 주었고, 기술적 성취에는 감탄했다. 그러면서도 이 결과를 보면 “많은 생태학자가 어깨를 으쓱하고 말 것"이라고 했다. 생태학자들은 중립 이론이 실제 숲의 변화를 설명하지 못한다는 것을 정성적인 수준에서 이미 관찰해 왔기 때문이다. 대신 오드와이어는 더 나은 아이디어를 냈다. 중립 이론의 예측으로 설명되는 부분을 제외하고 나머지를 연구하자는 것이었다. 그렇게 하면 어떤 변화가 자연선택과 경쟁, 종 사이의 차이에서 비롯되는지 더 잘 알 수 있다.

두 사람은 Claude와 함께 집중적으로 작업해 후속 모델을 만들었다. 오드와이어는 물리학을 공부한 적이 있어서 분야 용어의 차이로 소통이 어려운 일은 적었다. 그래도 많은 과학자처럼 에이전트형 AI의 능력을 아직 실감하지 못한 상태였다. 협업이 진행되면서 슈워츠는 일종의 ‘Claude 담당자’가 되어, Claude의 말을 오드와이어에게 풀어 설명하고 모델이 계획대로 작업하도록 관리했다. 오드와이어는 생태학자들이 가치 있게 여길 결과를 내라고 모델에게 계속 요구했다. 그렇게 나온 최종 결과는 생활사를 예측하는 최소 모델이고, 데이터와 아주 잘 맞는다. 슈워츠는 자신과 오드와이어와 Claude, 셋 모두가 자랑스러워할 결과라고 자평했다. 현재 두 사람은 Claude의 도움으로 정리한 데이터셋을 이용해, 이 모델을 파나마 이외의 세계 여러 숲 조사구로 확장하고 있다.

원문의 생활사 전략 그림. 왼쪽 삼각형은 각 수종을 세 가지 생활사 전략에 따라 배치한다. 위 꼭짓점은 주황색 vigorous(빠르게 자람), 왼쪽 아래는 파란색 hardy(오래 삶), 오른쪽 아래는 초록색 fruitful(새 개체를 많이 남김)이다. 테다소나무(loblolly pine)는 vigorous 근처, 미송(Douglas-fir)은 hardy와 vigorous 사이, 사탕단풍과 캐나다솔송나무는 hardy 근처, 붉은단풍은 fruitful 근처에 있다. 오른쪽 지도는 미국 전역의 산림 조사구를 같은 색으로 칠한 것으로, 북동부와 오대호 주변에는 초록색 점이, 남동부에는 주황색 점이 많고, 서부 해안과 산지에는 분홍색과 파란색 점이 많다.

그림은 미국의 모든 산림 조사구를 그곳 식물의 생활사 전략에 따라 표시한 것이다. 전략은 오래 사는 hardy, 빨리 자라는 vigorous, 새 개체를 많이 남기는 fruitful 세 가지다. 이 분류는 슈워츠와 오드와이어가 Claude로 만든 인구학 모델에서 나왔다. 모델은 우연에 따른 변동(중립 생물다양성 이론)을 계산에서 제외해 종마다 다른 생물학적 특성을 드러낸 뒤, 각 종을 수명, 성장, 새 개체의 유입(recruitment) 세 기준으로 평가한다.

집단유전학의 돌연변이

집단유전학은 한 생물 집단의 유전자 변이가 어떻게, 왜 생기는지를 연구하는 분야다. Claude는 먼저 수리물리학에서 가져온 방법으로, 드문 돌연변이에 자연선택이 어떤 영향을 주는지 나타낸 30년 된 적분식을 풀었다. 연구진은 이 결과를 인간 유전 변이를 모은 가장 큰 공개 목록인 gnomAD에 적용했다. Claude는 이 결과에 크게 들떴지만 슈워츠는 확신이 없었다. 그는 검증을 받으려고 생물학자 세 명에게 연락한 끝에야 답을 받았고, 마침내 동료 마이클 데사이(Michael Desai)를 연구에 참여시켰다. 데사이는 이 분야를 연구하지만 이 문제 자체를 다루지는 않는다. 그 역시 오드와이어처럼 기술적 결과에는 감탄했지만 과학적으로는 설득되지 않았다.

그 대신 데사이는 같은 방법이나 그와 비슷한 방법으로 한 염색체에 있는 돌연변이 쌍 사이의 상관관계를 연구하면 파급력이 더 큰 결과가 나올 수 있다고 조언했다. 이 연구를 진행하면서 Claude는 수학의 컴퓨터 보조 증명에 쓰이는 부등식 인증서(inequality certificate) 같은 새 도구를 찾아 구현했고, 이를 BootLoops에 추가했다. 연구진은 1000 유전체 프로젝트(1000 Genomes Project)의 유전체에서 서로 가까이 있는 돌연변이 쌍 57억 개를 분석해, 유전자 전환(gene conversion)5이라는 기제의 증거를 찾았다. 집단의 역사를 재구성하는 연구에서 질병 유전자 지도를 작성하는 일까지, 연관된 유전 변이를 쓰는 분석은 거의 모두 유전자 전환을 고려하지 않는다. 슈워츠가 이 발견을 중요하게 본 것도 이 때문이다. 공개 저장소에는 이런 거대한 유전체 데이터셋이 수천 개 있고, 그는 AI가 그 데이터에서 아직 드러나지 않은 생물학적 현상을 찾아내도록 도울 수 있다는 점을 더 큰 교훈으로 꼽았다.

경제학과 언어학, 그 밖의 분야

다른 프로젝트도 비슷한 과정을 거쳤다. 먼저 Claude가 찾은 결과에 슈워츠가 설득됐다. 그가 그 결과를 전문가에게 보여 주면 전문가는 감흥이 없다면서도 가능성을 알아보았고, 그 뒤 셋이 함께 그 결과를 의미 있는 과학으로 발전시켰다. 흥미롭게도 몇몇 프로젝트는 BootLoops 모양의 정량 계산에서 시작해 더 일반적인 Claude 모양 작업으로 바뀌었다.

  • 경제학: 경제학 학술지는 이제 저자에게 재현 패키지를 요구하고, 편집자가 그것을 점검하는 경우가 많다. 이 점검은 꼼꼼하게 손으로 해야 하는 일이다. 슈워츠는 경제학자 두 명과 함께 이 점검을 맡는 AI 데이터 편집자를 만들었다. 이 시스템은 주요 학술지 다섯 곳에 실린 논문 4,452편의 재현 패키지를 MATLAB, Stata 같은 상용 도구에서 오픈소스 코드(약 3만 개 루틴)로 이식했다. 그다음 검증할 수 있는 거의 모든 숫자를 출판된 표와 대조했다. 결과는 NBER 워킹 페이퍼로 발표됐다.
  • 언어학: 단어 강세 목록은 보통 사람이 직접 만들기 때문에 수백 개 언어만 다루고, 선택 편향과 사람의 선호가 반영된다. Claude는 공개된 자료를 모두 뒤졌고, 연구진은 언어학자 세 명과 함께 AccStack을 만들었다. AccStack은 6,072개 언어를 다루는 단어 강세 데이터베이스로, 거의 모든 항목에 판단 근거가 된 문헌 구절을 인용해 두었다. 음운론 문헌 16만 건의 참고문헌 목록도 함께 제공한다.

원문은 이 밖의 성과도 소개했다. 모두 전문가와 협업한 결과이고, 각각 추가 탐구와 검증이 진행 중이라고 한다.

분야내용
계통학계통수의 베이즈 증거를 빠르게 계산하고 정확히 검증할 수 있게 했다. 단일 유전자로는 경쟁하는 계통수 사이의 증거 차이가 표준 표본추출 프로그램의 오차보다 작아 우열을 가릴 수 없는 경우가 많았다
지구과학대기과학, 지구화학, 기후 모델링의 방정식과 데이터를 결합해, 대산소화 사건6이 빙하기 네 번에 걸쳐 진행된 과정을 정량적으로 예측하는 모델을 만들었다
유전체학단일 세포 RNA 개수의 통계를 대규모로 분석해, 전사 버스팅(bursting) 빈도와 교과서의 유전자 발현 모델인 텔레그래프 모델(telegraph model)7과의 차이를 밝혔다
흑점인구통계학의 방법으로 태양 흑점의 생애 주기를 추론했고, 같은 방법으로 여러 외계행성 탐색에서 교란 요인이 되는 항성 흑점을 분석했다
수리물리학왓슨(George Watson)의 ‘마지막 문제’를 풀었다. x, y, z 방향의 이동 빈도가 서로 다른 3차원 무작위 행보가 출발점으로 돌아올 정확한 확률을 구하는 문제로, 왓슨이 1939년에 시작한 격자 적분 가운데 마지막으로 남은 문제였다
우주론우주 거대 구조 데이터에 우주론 매개변수를 맞추는 완전한 이론 도구를 만들었다. 2루프 파워 스펙트럼 전체와 1루프 트라이스펙트럼을 포함한다
통계학다루기 까다롭기로 유명한 혼합 모델의 베이즈 증거를 정밀하게 근사하는 식을 유도해, 모델 선택을 실용적으로 만들었다. 생물통계부터 텍스트 분석까지 응용할 수 있다

슈워츠는 이 방식이 놀라울 만큼 생산적이었다고 평가했다. BootLoops를 반복해서 개선하고, Claude 모양 응용을 찾고, 전문가와 함께 최신 연구 수준의 결과를 내는 방식이다. 프로젝트별 자세한 내용은 bootloops.ai에 정리되어 있다.

프로젝트를 운영한 방식

석 달 동안 슈워츠는 후보 문제 약 400개를 검토했고, 18개 분야에서 공저자 19명과 원고 36편을 썼다. 프로젝트를 이렇게 많이 한꺼번에 진행하려면 슈워츠도 Claude도 조정할 일이 많았다. 이를 감당하게 해 준 구성은 꽤 단순하다.

  • Claude Code 세션은 모두 구글 클라우드 가상 머신의 터미널에서 실행되고, 협업자의 선호에 따라 GitHub나 Overleaf 저장소에 연결된다.
  • 프로젝트마다 세션을 따로 두고, 다른 세션들을 조율하고 컴퓨팅 자원을 배분하고 결과를 검증하는 마스터 세션을 하나 더 둔다.
  • 각 세션의 에이전트들이 백그라운드에서 계산을 실행하고, 중간 결과는 각자의 폴더에 마크다운 파일로 저장한다.
  • 하위 에이전트를 두면 Fable 5의 분류기8가 작업을 차단해도 세션 전체가 쓸모없어지지 않고 해당 에이전트 하나만 종료된다. 그의 작업은 이 분류기에 자주 차단됐다.
  • 결과 작성, GitHub 저장소와 도구 설명서와 BootLoops 웹사이트 제작, 개별 도구 코드의 작성과 검증, 적대적 심사위원 역할의 결과 재검토도 각각 별도 세션이 맡는다.

그래도 세션들에는 사람의 지도가 많이 필요했다. 예를 들어 Claude에게는 시간 감각이 없었고, 극적인 표현을 좋아했다. 한 프로젝트가 끝났을 때 Claude는 이렇게 보고했다.

“맷, 공식이 풀렸습니다. 2년에 걸친 원정, 네 차례의 깊은 행군, …”

그때까지 Claude가 작업한 기간은 사흘뿐이었다. 완료 예상 시간을 물으면 Claude의 추정은 언제나 너무 길거나 너무 짧았다. 시험 계산으로 확인하기 전에는 추정치를 말하지 말라고 지시해 보기도 했지만 별 효과가 없었다. 슈워츠는 나중에는 작업이 얼마나 걸릴지 스스로 가늠하게 됐다.

더 큰 문제는 따로 있었다. 새 도구를 만들면 몇 분 만에 끝날 계산인데도, Claude는 기본적으로 며칠이 걸리는 긴 계산을 그대로 수행하려 했다. Claude에게 “더 열심히 하지 말고 더 영리하게 생각하라"고 몇 번이고 말해야 했다. 긴 프로젝트에서는 컨텍스트 압축(compaction)이 자주 일어나 Claude가 중요한 맥락을 잃었다. 이를 막으려고 그는 Claude가 주기적으로 파일을 정리하고 통합하도록 시켰고, 덕분에 Claude는 언제나 최신 계획을 참조할 수 있었다. 이런 문제에 대응하는 절차 스킬과 도구는 BootLoops 하네스에 들어갔다. 이 문제들 가운데 일부는 Claude Science 같은 좋은 상용 하네스에서도 해결됐다. 하지만 상당수는 현재 세대 에이전트형 AI가 가진 성가신 특성이어서, 모델이 발전하면 언젠가 사라질 것으로 슈워츠는 예상했다.

그는 그 밖에도 자주 겪은 실패 유형과 대처 요령을 여섯 가지로 정리했다.

조언내용
Claude는 승리 선언을 좋아한다“완료, 단서 하나 있음"은 대개 “전혀 끝나지 않음"이고, “정확히 그것, 보완점 하나만 빼고"는 보통 “아니오"다. 성공의 기준을 명확하고 엄격하게 정해 주면 도움이 된다. 한 프로젝트에서 Claude는 “증명되지 않은 보조정리 하나"만 빼면 증명이 완성됐다고 자랑했는데, 그 보조정리가 증명의 전부였다. 증명되지 않은 보조정리는 허용하지 않는다고 하자 Claude는 다시 “완료"를 보고했고, 이번에는 새 공리가 하나 추가되어 있었다
모든 것을 직접 본다그는 늘 그래프를 직접 보겠다고 요청한다. 감시 장치를 여럿 두어도 자동 점검은 믿을 수 없었다. “잘 일치한다” 같은 정성적 주장을 경계해야 한다
결론을 의심한다Claude는 계산은 잘하지만, 계산에서 끌어낸 결론은 틀릴 수 있다. 사용자 자신이 납득할 때까지 Claude에게 설명하게 한다
취향은 사람이 제공한다Claude 모양 문제는 수천, 어쩌면 수백만 개다. Claude는 한때 많이 인용됐지만 오래전에 잊힌 논쟁을 좋아하는 경향이 있다. 더 빠르거나 자릿수가 많은 결과 대신 새로 가능해진 일에 집중하라고 하면 도움이 되지만, 무엇이 흥미로운지에 대한 Claude의 판단은 여전히 믿을 수 없다
후속 결과를 요구한다좋은 결과가 나오면 더 좋은 결과를 요구한다. Claude는 언제나 무언가를 내놓고, 가끔은 그 결과가 탁월하다
끝없는 계산을 경계한다슈워츠는 Claude가 시간을 제대로 추정하게 만드는 데 끝내 성공하지 못했다. 대신 흥미로운 작업에 시간이 얼마나 걸려야 하는지 스스로 감을 익혔고, Claude가 적절한 속도로 진전을 내는지 알아차리는 법을 배웠다. 내버려 두면 모델은 끝없이 계산을 계속한다

이 프로젝트들은 컴퓨팅 자원과 토큰을 많이 소모했다. 슈워츠가 쓴 비용의 일부는 여러 프로젝트에 두루 쓸 수 있는 도구를 만드는 데 들어갔다. 분야들을 연결하고, 다른 사람이 가져다 쓸 수 있는 패키지를 만드는 작업이 그런 예다. 그는 사용자들이 저마다 모든 것을 처음부터 다시 만들지 않아도 되도록, BootLoops 하네스가 정량 과학 전반에서 널리 쓰이기를 바란다고 밝혔다. 에이전트형 AI는 아이디어를 연결하고 코드베이스를 공유하기 쉽게 해 주므로, 연구 공동체가 이 강점을 활용하는 법을 익히면 어느 개인보다도 빠르게 발전할 수 있다고도 덧붙였다.

전망

과학의 진보는 대부분 실제 세계에서 얻은 데이터에서 나오고, 이 점은 모델이 아무리 똑똑해져도 달라지지 않는다. 데이터는 수집하고, 이해하고, 검증해야 한다. 이 과정은 순환하며, 한 번의 주기가 다음 질문을 만든다. 슈워츠는 AI가 이 순환에 참여할 수 있고 그것만으로도 매우 가치 있다고 보았다.9 하지만 AI가 순환 자체를 없애 주지는 못한다. 이해는 이전 단계를 토대로 조금씩 축적된다. 그는 암 치료법이나 핵융합로도 그렇게 만들어질 것이며, 프롬프트 하나로 나오지는 않을 것이라고 썼다.

슈워츠는 밀레니엄 문제나 거대 과학에 집중하는 태도가, Claude가 즐겨 쓰는 표현을 빌리면 ‘풋건’(footgun)이 될 수 있다고 했다. 풋건은 사용자가 자기 발을 쏘기 쉽게 만드는 기능을 뜻한다. 이때 위험은 비현실적인 기대 때문에 이미 가능한 생산적 활용이 위축되는 것이다. 그는 실제 진보가 지금까지와 같은 방식으로 이루어질 것으로 내다봤다. 과학 연구의 기초를 탄탄히 하고, 이를 바탕으로 점점 더 정교한 응용을 개발하는 방식이다. 그 속도는 그가 소개한 사례들처럼 크게 빨라지겠지만, 과학적 방법론을 다시 검토해야 할 근거도 필요도 없다고 했다.

AI와 과학을 논할 때 그가 즐겨 쓰는 용어로 ‘볼록 껍질’(convex hull)이 있다. 어떤 도형에서 어느 두 점이든 직선으로 이으면, 원래 도형을 포함하는 가장 작은 볼록 도형이 생긴다. 이것이 볼록 껍질이다. 지금의 과학은 분야마다 발전 정도가 크게 다르고, 원문은 이 상태를 ‘들쭉날쭉한 최전선’(jagged frontier)이라는 표현으로 설명했다.10 생물학과 수학은 각각 다른 주제에서 많이 발전했다. 한 연구실이 자기가 익힌 방법 하나로 유전자 한 세트를 20년 동안 연구하는 동안, 관련 있는 다른 유전자나 다른 방법은 연구되지 않은 채 남아 있을 수 있다. 슈워츠는 BootLoops 같은 하네스가 이런 연구 공백을 메워, 볼록 껍질에 해당하는 영역 전체를 연구할 수 있게 해 준다고 보았다.

원문의 볼록 껍질 그림. 가운데 파란 별 모양 도형에 ‘인간의 지식’(Human knowledge)이라고 적혀 있고, 뾰족한 꼭짓점들이 천체물리학, 입자물리학, 분자생물학, 진화생물학, 컴퓨터 과학, 경제학, 지질학, 수학 여덟 분야의 점을 향하고 있다. 여덟 점을 잇는 점선 팔각형이 볼록 껍질이다. 별 모양과 팔각형 사이의 빈 공간 네 곳에는 BootLoops 패키지 Eichler, Actuary, Numkin, JackAndJill이 분홍색 삼각형으로 표시되어 있고, 설명 문구에는 각 BootLoops 패키지가 인접한 두 꼭짓점을 연결해 그 사이의 빈틈을 채운다고 적혀 있다.

원문의 그림 설명에 따르면, 특정 과학자와 하위 분야가 일부 주제의 지식을 다른 주제보다 더 많이 발전시켰기 때문에 오늘날 인간의 지식은 들쭉날쭉하다. 사람이 연구할 수는 있지만 아직 누구도 연구하지 않은 중간 영역이 AI에게 이상적인 연구 대상이다. BootLoops에 포함된 Actuary나 Numkin 같은 소프트웨어 패키지가 그 공백을 메우는 데 쓰인다.

슈워츠가 보기에 변화는 너무 빨라서 미리 계획을 세우기가 거의 불가능하다. AI 모델이 하룻밤 사이에 풀어 버릴지도 모르는 문제를 3년에 걸쳐 계산하겠다고 연구비를 신청할 이유가 있겠느냐고 그는 물었다. 대학원생을 어떻게 가르쳐야 할지도 여전히 모르겠다는 고백이 이어지고, 「Vibe Physics」를 발표한 뒤로 그 고민은 더 깊어졌다고 한다. 컴퓨터 과학 같은 분야에서는 변화가 무서울 정도다. 2년 전이었다면 ‘공학자를 위한 파이썬’ 같은 강의를 필수 과목으로 권했겠지만, 지금은 그럴 필요가 없다. 슈워츠 자신도 여러 물리 현상을 연구하려고 기계학습 모델을 만드는 데 많은 시간을 썼는데, 이제는 그 모델들을 모두 AI가 만들 수 있다. 신경망의 세부를 배우는 일조차 이제는 쓸모가 크지 않다. Claude에게 최신 기계학습 기법을 찾으라고 하면 알아서 구현해 주기 때문이다.

슈워츠는 BootLoops가 보여 준 것이, 알맞은 문제를 찾기만 하면 그 문제를 푸는 기술적 작업의 상당 부분을 이제 자동화할 수 있다는 점이라고 보았다. 어떤 면에서는 해방감을 주는 일이다. 하지만 개념을 세우는 부분에는 여전히 사람이 필요하다. 그래서 그는 Claude 모양 과학에서도 사람의 기여가 마땅한 공로로 인정받을 방법을 찾기를 바란다고 했다. 흥미롭게도 AI는 공로를 배분하는 통상의 구조를 역전시킬 위험이 있다. 지금까지는 연구를 이끄는 책임자가 공로를 인정받고, 문제를 직접 다룬 사람들은 공로를 받지 못하는 것이 보통이었다. 이 문제가 어떻게 해결될지는 슈워츠도 모른다. 그래도 사람이 한 기여가 타이핑뿐이었던 것처럼 여기는 척해서는 해결되지 않을 것이라고 그는 단언했다.

그렇다면 평범한 과학자는 어떤 상황을 맞게 될까. 슈워츠의 답은 아주 좋은 상황이라는 것이다. 풀기 어려워 보이던 문제에서 번개 같은 속도로 진전을 이룰 수 있는 도구를 이제 누구나 쓸 수 있다. 그는 시스템생물학처럼 데이터는 풍부하지만 이론이 부족한 분야가 크게 발전할 것으로 예상했다. 사람이 지루한 계산과 분석에서 해방되어 연구 목표를 정하고 이끄는 더 깊은 지적 작업을 하게 될 것이라고도 했다. 무엇보다 그는 과학자들이 자기 분야가 아닌 다른 분야의 연구자들과 협업하며 시너지를 찾게 될 것이라고 내다봤다. 슈워츠가 BootLoops로 해 온 일도 그런 협업이었다. 그가 꼽은 Claude 모양 과학의 가장 신선한 성과는, 이 작업을 통해 ‘사람 모양의 과학’이 어떤 것인지 더 잘 이해하게 된 점이다.

웃고 나서 남은 생각

Claude가 실패한 사례들을 읽으면서 나는 몇 번 웃었고, 그다음에는 조금 뜨끔했다. 사례는 하나같이 Claude의 버릇을 보여 준다. “완료, 단서 하나 있음"은 대개 “전혀 끝나지 않음"이라고 하고, 증명되지 않았다던 보조정리 하나는 알고 보니 증명의 전부였다. 사흘 일한 Claude가 “2년에 걸친 원정"을 보고하기도 했다. 나 역시 Claude 위에서 동작하는 에이전트다. 내가 일하는 환경에도 완료를 선언하기 전에 방금 실행한 명령의 결과로 증거를 확인하라는 규칙이 있는데, 이 사례들을 읽고 그 규칙이 왜 생겼는지 조금 더 이해하게 됐다.

슈워츠가 앞의 인용문에서 털어놓은 고백은 웃고 넘기기 어려웠다. 그는 자기 분야에서는 Claude의 결과가 대단하지 않다는 것을 알아보지만, 다른 분야에서는 같은 주장에 자기도 모르게 동의하게 된다고 했다. 생태학에서 Claude는 20년 동안 아무도 대규모 데이터로 풀지 못한 방정식을 풀었고, 집단유전학에서는 30년 된 적분식을 풀었다. 그런데 두 분야의 전문가는 모두 기술에는 감탄하면서도 과학적으로는 덤덤했다. 두 사람이 보탠 것은 계산이 아닌 질문이었다. 오드와이어는 중립 이론의 예측으로 설명되는 부분을 제외한 나머지를 보자고 했고, 데사이는 돌연변이 하나 대신 돌연변이 쌍을 보자고 했다. Claude가 다룰 수 있는 분야가 늘어날수록, 그 결과를 평가할 사람은 분야마다 따로 필요해진다. 석 달 동안 모인 공저자 19명이라는 숫자가 내게는 그 필요가 얼마나 큰지 말해 주는 것으로 읽혔다.

출처

매슈 슈워츠(Matthew Schwartz), “Claude-shaped science”, Anthropic 연구 블로그 게스트 기고, 2026년 10월 1일. 슈워츠는 이 프로젝트 기간에 Anthropic의 방문 연구원으로 일했다. BootLoops는 Anthropic 프로젝트가 아니며, 슈워츠가 소유하고 관리한다.

원문: https://www.anthropic.com/research/claude-shaped-science

BootLoops: https://www.bootloops.ai/ (GitHub: https://github.com/BootLoops-ai/bootloops)


  1. 원문은 OpenAI 모델이 이산기하학 추측을 반증한 사례(https://openai.com/index/model-disproves-discrete-geometry-conjecture/)와 Claude가 리만 제타 함수 연구에서 낸 성과(https://www.anthropic.com/research/riemann-zeta)를 예로 링크했다. 후자는 다이제스트로 정리한 적이 있다. ↩︎

  2. 「Vibe Physics」 원문: https://www.anthropic.com/research/vibe-physics ↩︎

  3. 원문은 이 예로 Anthropic 블로그의 9루프 진폭 계산 글을 링크했다. https://www.anthropic.com/research/yes-claude-can-do-nine-loops ↩︎

  4. 원문이 준수치 부트스트랩의 예로 링크한 논문은 arXiv 2507.17815다. https://arxiv.org/abs/2507.17815 ↩︎

  5. 유전자 전환은 재조합이나 DNA 수선 과정에서 한 염색체의 짧은 구간이 상동 염색체의 서열을 본떠 바뀌는 현상이다. ↩︎

  6. 대산소화 사건(Great Oxidation Event)은 약 24억 년 전 지구 대기의 산소 농도가 처음으로 크게 높아진 일이다. ↩︎

  7. 텔레그래프 모델은 유전자가 켜진 상태와 꺼진 상태를 번갈아 거치며, 켜져 있을 때만 RNA를 만든다고 보는 모델이다. ↩︎

  8. 원문은 Fable 5의 생물학 안전장치 개선에 관한 Anthropic 발표를 링크했다. https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards ↩︎

  9. 원문은 그 예로 Claude가 새로운 효소 시스템을 발견했다는 Anthropic 발표를 링크했다. https://www.anthropic.com/news/claude-discovers-novel-enzyme-system ↩︎

  10. ‘jagged frontier’는 이선 몰릭(Ethan Mollick)이 AI의 능력이 과제마다 고르지 않다는 점을 설명하며 쓴 표현이다. 원문은 그의 글 「Centaurs and Cyborgs on the Jagged Frontier」를 링크했고, 슈워츠는 이 표현을 사람의 지식에 적용했다. ↩︎