3줄 요약

  1. 이 논문은 2026년 9월 24일 arXiv에 공개됐다. 스탠퍼드대, 텔아비브대, 프랑스 LAPTh(사부아 몽블랑대) 소속 연구자와 독립 연구자 등 7명이 함께 썼다. 연구진은 무작위로 초기화한 트랜스포머 두 개를 함께 학습시킨다. 학습자는 생성자가 브레인퍽 계열의 튜링 완전 언어로 짠 프로그램을 실행해 얻은 바이트열로 다음 토큰 예측을 학습한다. 두 모델의 경사 갱신에 쓰이는 데이터 가운데 자연 데이터는 하나도 없다.
  2. 이렇게 합성 데이터만으로 학습한 학습자의 제로샷 손실은 텍스트, 이미지, 음악, 음성, 코드 데이터에서 모두 연산량의 거듭제곱 법칙에 따라 줄었다. 같은 프로그램 공간에서 프로그램을 무작위로 뽑아 학습시키면 손실이 훨씬 느리게 줄었다. 학습자는 문맥 내 학습 능력도 갖췄고, 생성자는 피보나치 수열이나 등비수열을 출력하는 프로그램을 스스로 찾아냈다.
  3. 연구진은 자연 데이터가 가진 정보를 특정 세계에만 해당하는 우연적 정보와 여러 데이터 생성 과정이 공유하는 보편 구조로 구분했다. 셀프 플레이 학습에서는 보편 구조에 관한 정보만 늘어난다. 그런데도 스케일링 지수는 자연 데이터 사전학습과 비슷했다. 연구진은 자연 데이터를 추가할 때 나타나는 성능 개선의 상당 부분이 보편 구조를 학습한 결과일 수 있다고 조심스럽게 해석했다. 실험에 쓴 모델은 모두 파라미터가 2,500만 개 미만이었다.

학습 데이터를 모델이 직접 만든다는 발상

언어 모델은 더 많은 인터넷 데이터로 사전학습 규모를 늘리면서 발전해 왔다. 논문은 그 데이터를 여전히 사람이 모델 대신 준비한다고 지적했다. 대규모 데이터 정제, 데이터 혼합 비율 설계, 사람이 설계한 합성 데이터 생성기가 모두 그런 작업에 해당한다. 연구진이 제안하는 더 일반적인 방향에서는 모델이 자기 성능을 높이는 데 가장 쓸모 있는 학습 데이터를 스스로 생성한다. 그렇게 되면 학습 데이터의 공급량은 사람이 가진 지식이 아닌 연산량의 제약만 받는다. 논문은 이 방향을 비터 레슨(Bitter Lesson)을 학습 데이터에까지 적용하는 일로 소개했다.1

연구진은 이 논문을 그 구상을 실현하기 위한 첫 개념 증명으로 소개했다. 이 논문에서 합성 데이터 생성은 탐색 문제로 정의된다. 생성자는 계산 가능한 모든 구조 가운데 학습에 쓸모 있는 데이터를 찾아야 한다. 탐색 공간으로는 만능 튜링 기계(universal Turing machine)의 프로그램을 쓴다. 튜링 완전한 언어라면 계산 가능한 데이터 생성 과정을 원리상 모두 프로그램으로 표현할 수 있고, 특정 분야에 맞춘 구조를 미리 부여할 필요도 거의 없기 때문이다.

하지만 프로그램 공간은 매우 넓고, 학습자에게 쓸모 있는 출력을 내는 프로그램은 그 가운데 일부에 불과하다. 게다가 어떤 프로그램이 쓸모 있는지는 학습자의 실력이 향상되면서 달라진다. 이 때문에 연구진은 학습자에 맞춰 적응하는 셀프 플레이를 택했다. 쓸모 있는 구조를 미리 지정하지 않고, 학습이 진행되는 동안 어떤 프로그램이 학습자에게 가장 유용한지를 생성자가 찾아내게 한다.

연구진은 이 설계가 솔로모노프 귀납(Solomonoff induction)으로 대표되는 보편 예측(universal prediction) 이론을 계승한다고 설명했다. 보편 예측 이론은 가설 집합이 계산 가능한 모든 데이터 생성 과정을 포함하고 학습자의 연산 능력에 제한이 없을 때 귀납이 어떻게 가능한지를 형식화한다. 이 논문의 목표는 그 이상적인 보편 예측을 실제로 계산할 수 있는 효율적인 근사로 구현하는 데 있다.

연구진의 핵심 가설에 따르면, 계산 가능한 데이터 생성 과정의 공간을 셀프 플레이로 탐색하면 복사, 재귀, 계층적 합성처럼 범용적인 예측 규칙성을 발견할 수 있고, 이 규칙성은 자연 데이터 예측도 개선한다. 연구진은 이런 규칙성이 특정 데이터셋에만 해당하는 개별 지식이나 기호, 모달리티 같은 우연적 정보(contingent information)와 무관하므로, 데이터를 생성한 과정이 달라도 전이될 수 있다고 보았다.

가설을 검증하기 위해 연구진은 두 모델을 모두 무작위로 초기화하고, 학습자의 학습 데이터를 전부 셀프 플레이로만 만드는 백지(tabula rasa) 조건에서 실험했다. 이 조건에서 자연 데이터 성능이 오른다면, 그 향상은 모두 셀프 플레이 과정에서 얻은 것이 된다. 평가는 학습에 쓰지 않은 텍스트, 이미지, 음성, 선율, DNA, 수학 데이터에서 제로샷으로 진행했다.

팬시 스티커 화풍의 서소영이 두 탁자 사이에 서 있다. 왼쪽 탁자에는 책 더미와 사진 액자, 레코드판이 천에 덮여 리본으로 묶여 있다. 오른쪽 탁자에서 서소영은 프로그램 카드 한 장을 들고 작은 민트색 테이프 기계를 돌리고, 기계에서 나오는 파스텔 구슬을 학생모 쓴 병아리가 바라본다.

생성자와 학습자가 번갈아 학습하는 라운드

이 방법에는 자기회귀 언어 모델 두 개가 쓰인다. 프로그램의 출력을 예측하는 모델을 학습자 $\pi_\theta$라고 부르고, 프로그램을 만드는 모델을 생성자 $g_\phi$라고 부른다. 두 모델은 구조가 같은 디코더 전용 Llama 트랜스포머지만 파라미터는 따로 갖는다. 학습자를 다음 토큰 예측으로 학습시키는 동안 생성자는 강화학습으로 학습한다. 셀프 플레이 한 라운드는 세 단계로 진행된다.

  1. 생성자에서 프로그램 $N$개를 샘플링한다.
  2. 각 프로그램을 고정된 만능 튜링 기계 $U$에서 무작위 입력 테이프 $\omega$와 함께 실행해 출력 바이트열 $y = U(x, \omega)$를 얻는다.
  3. 이 출력 바이트열로 다음 토큰 손실을 계산해, 학습자의 파라미터를 경사 하강으로 한 번 갱신한다. 생성자는 학습 진척(learning progress) 보상으로 정책 경사 갱신을 한 번 받는다. 생성자는 기존 프로그램으로 지도 미세조정을 받아 앞서 배운 내용을 유지한다. 또 변이 프로그램으로 지도 미세조정을 받아 새로운 프로그램을 탐색한다.

프로그램 언어로는 Grau-Moya 등(2024)을 따라 브레인퍽(Brainfuck)과 비슷한 튜링 완전 언어를 쓴다.2 기본 명령은 여덟 개가 있다. <와 >는 테이프 헤드를 왼쪽 또는 오른쪽 칸으로 이동시킨다. +와 -는 칸의 값을 1씩 늘리거나 줄인다. [와 ]는 반복문을 만들고, .은 바이트를 출력하며, ,는 입력 테이프에서 바이트를 읽는다. 예를 들어 +++[>+.<-]F는 첫 칸을 반복 횟수로 삼아 세 번 반복하면서 둘째 칸의 값을 하나씩 늘려 출력한다. 출력은 1, 2, 3이고, 프로그램이 멈춘 뒤로는 0이 채워진다. F는 프로그램 종료 토큰이다.

연구진은 여기에 한 글자짜리 매크로 명령 10개를 추가했다. 칸 비우기, 옆 칸에 값 더하기, 다음 0인 칸 찾기처럼 사람이 브레인퍽 프로그램을 짤 때 자주 쓰는 패턴을 한 글자로 줄인 명령으로, 예비 실험에서 셀프 플레이의 효율을 높였다고 한다. 비교 대상 기준선도 모두 같은 확장 명령 집합을 쓰므로, 추가 명령 때문에 결과 차이가 생기지는 않는다.

연구진은 어떤 문자열이든 실행할 수 있도록 실행 규칙을 설계했다. 짝이 맞지 않는 괄호는 아무 동작도 하지 않는다. 테이프는 원형이라 헤드가 한쪽 끝 칸에서 한 칸 더 가면 반대쪽 끝 칸이 되고, 칸의 값은 256으로 나눈 나머지로 계산한다. 실행은 단계 예산 소진, 프로그램 끝, 출력 길이 한도 가운데 먼저 도래한 조건에서 항상 멈춘다. 따라서 문법 오류나 메모리 오류로 실패하는 프로그램이 없다. 무작위 입력 테이프 덕분에 프로그램 하나는 출력 바이트열의 확률 분포 하나를 표현한다. 학습자가 학습하는 대상은 프로그램 자체가 아닌 이 출력 바이트다.

토큰화는 바이트 단위로 하고, 어휘로는 256개 바이트 값을 쓴다. 만능 기계의 출력이 원시 바이트이기도 하고, 텍스트, 이미지, 오디오를 가리지 않고 다음 바이트 예측 능력을 같은 조건에서 비교할 수 있기 때문이다. 프로그램 앞에는 바이트 S, 출력 앞에는 O를 붙인다. 생성자가 프로그램을 생성할 때는 기본 명령 8개, 매크로 명령 10개, 종료 토큰 F만 고를 수 있도록 로짓을 제한한다.

라운드마다 학습에 쓰는 프로그램 풀은 세 종류로 구성된다. 현재 생성자에서 새로 샘플링한 프로그램은 넓은 범위를 탐색하고, 보상이 높았던 프로그램을 조금 고친 변이 프로그램은 유망한 프로그램과 비슷한 프로그램을 세밀하게 탐색한다. 이전 라운드에서 가져온 재생(replay) 프로그램은 앞서 발견한 유용한 구조를 잊지 않게 한다.3 학습자는 세 종류 프로그램의 출력을 모두 학습한다.

논문 Fig. 1. 위쪽은 무작위로 초기화한 생성자가 프로그램을 만들고, 만능 튜링 기계가 이를 실행해 바이트열을 출력하고, 학습자가 그 바이트열을 학습하는 흐름도다. 자연 데이터인 텍스트와 이미지는 학습에 쓰지 않는다고 표시되어 있다. 가운데는 학습 라운드에 따른 학습자 파라미터 변화와 경사 벡터의 내적으로 생성자 보상을 계산하는 도식이다. 왼쪽 아래는 유효 연산량에 따른 검증 손실 그래프로 이미지 α=0.066, 텍스트 α=0.123, 선율 α=0.249이고, 오른쪽 아래는 문맥 내 예시 수에 따른 여섯 과제의 정답률 그래프다. Fig. 1. 셀프 플레이 사전학습의 개요. 출처: Cowsik et al., arXiv:2609.30063 (2026)

학습자의 학습 방향과 일치하는 프로그램에 주는 보상

생성자의 보상은 외부 피드백 없이 유용한 구조를 가진 프로그램을 골라낼 수 있어야 한다. 연구진은 처음에 기존 셀프 플레이 연구를 따라, 바이트열을 예측하기 어려운 정도를 보상으로 쓰는 방안을 검토했다. 그러나 이 보상에는 근본적인 실패 경로가 있다. 예측 가능한 바이트열에 무작위 바이트를 끼워 넣기만 해도, 유용한 구조 없이 얼마든지 예측하기 어려운 프로그램을 만들 수 있다.

그래서 연구진은 새 프로그램이 학습자가 실제로 배운 내용을 바탕으로 하는지를 평가하기로 했다. 연구진의 설명에 따르면 학습자의 파라미터 변화량이 그 정보를 요약한다. 재사용할 수 있는 구조에서 나온 학습 신호는 파라미터 변화에 누적되지만, 배울 수 없는 개별적 효과는 누적되지 않을 것이기 때문이다. 이에 따라 보상은 프로그램 출력에 대한 학습자의 경사가 학습자의 최근 학습 궤적과 얼마나 일치하는지로 정의된다.

$$r_i = \left| \left\langle \nabla_\theta \mathcal{L}(y_i;\theta_e),\; P_e \odot \delta\theta_e \right\rangle \right|, \qquad \delta\theta_e = \theta_{\lfloor e/2 \rfloor} - \theta_e$$

여기서 $e$는 현재 라운드 번호, $\theta_{\lfloor e/2 \rfloor}$는 현재 라운드의 절반 시점에 저장한 학습자 체크포인트다. $P_e = \mathrm{lr}/(\sqrt{\hat v_e}+\epsilon)$는 학습자의 AdamW 옵티마이저 상태에서 얻은 대각 스텝 연산자다. 비교 시점을 현재 라운드의 절반으로 잡으면 늦게 나타나는 신호도 측정할 수 있다. 학습이 진행될수록 비교에 사용하는 라운드 수가 늘어난다. 따라서 단기 변동의 영향이 줄어 신호가 안정된다. 시간이 지나면 초기의 실수도 비교 대상에서 제외된다.

연구진이 제시한 직관은 이렇다. 이미 익힌 프로그램은 경사가 거의 0이라 보상이 낮다. 관련 없는 구조나 배울 수 없는 구조를 포함한 프로그램은 경사가 학습자의 파라미터 변화 방향과 일치하지 않으므로 역시 보상이 낮다. 높은 보상은 학습을 크게 일으키면서도 그 방향이 최근의 학습 진척과 일치하는 프로그램이 받는다. 그 결과 생성자는 학습자가 아직 익히지 못했지만 지금까지 배운 것을 확장하면 배울 수 있는 프로그램을 집중적으로 생성하게 된다. 연구진은 전체 경사 벡터를 구성하지 않으려고 순방향 자동 미분(forward-mode automatic differentiation)으로 이 값을 계산했다. 이 보상은 작은 규모에서 여러 후보를 시험한 뒤 고른 것이며, AdamW 전처리를 넣는 것이 중요했다고 연구진은 밝혔다.

팬시 스티커 화풍의 장면. 병아리 발자국 길이 왼쪽에서 오른쪽으로 이어지고, 길 위에는 이미 밟은 파스텔 카드들이 놓여 있다. 학생모를 쓴 병아리가 길 끝에서 오른쪽을 보고 서 있다. 서소영은 몸을 숙여 병아리 앞에 새 하늘색 카드를 내려놓는다. 길에서 떨어진 오른쪽 위 구석에는 회색 낙서 뭉치에 파묻힌 카드가 방치되어 있다.

생성자는 KL 정규화한 기대 보상을 최대화한다.

$$J_{\mathrm{RL}}(\phi) = \mathbb{E}_{x\sim g_\phi}[r(x)] - \beta\,\mathrm{KL}(g_\phi \,\|\, g_0), \qquad g_0(x) = |\mathcal{A}|^{-\ell(x)}$$

기준 분포 $g_0$는 명령어를 균일하게 뽑아 만든 고정 사전 분포로, 프로그램 $x$의 확률을 그 길이 $\ell(x)$만으로 정한다. 길이에는 종료 토큰 F도 포함된다. 짧은 프로그램에 높은 확률을 주는 이 분포는 솔로모노프 사전 분포 $2^{-|p|}$에 대응한다. 생성자는 $g_0$에 가까운 상태에서 학습을 시작하고, 학습 내내 $g_0$와의 KL 발산으로 정규화된다.

정책 경사의 분산을 줄이기 위해서는 GRPO식 배치 단위 추정량을 쓴다. 라운드 풀 전체의 보상 평균과 표준편차로 보상을 정규화하고 KL 항을 뺀 값을 이점(advantage)으로 삼는다. 과거 정책에서 샘플링한 재생 프로그램에는 시퀀스 단위 중요도 비율을 곱해 보정한다. 로그 확률이 정의되지 않는 변이 프로그램은 정책 경사 계산에서 제외한다. 여기에 보상 가중 지도 미세조정(expert iteration)을 더해, 보상이 높은 프로그램을 생성자에 다시 증류함으로써 망각을 줄인다.4

연구진은 파라미터 100만 개인 학습자로 보상 설계를 절제 실험했다. 아래 표는 논문 Table 5에서 일부 데이터셋을 발췌했다. 값은 시드 4개 앙상블의 검증 손실(바이트당 비트)이며 낮을수록 좋다.

데이터기본 보상균일 샘플링부호 유지보상 섞기직전 1스텝 비교손실 감소량부호 반전
텍스트(DCLM)5.347.755.065.966.397.4010.62
Metamath3.387.393.474.394.346.4610.52
C 소스4.167.924.104.794.956.3710.60
DNA2.293.022.452.503.223.578.37
arithmetic0.227.940.510.731.261.9210.64
선율(Mutopia)2.207.092.213.263.354.1411.00
CIFAR-105.967.836.147.147.227.5910.59
무작위 바이트8.028.028.058.028.298.6110.57

균일 샘플링 조건에서는 생성자를 없애고 명령어를 균일하게 뽑은 프로그램으로 학습했다. 보상에서 절댓값을 빼고 부호를 유지하면 텍스트와 C 소스에서는 조금 나았지만, 나머지 대부분의 데이터에서는 나빠졌다. 같은 풀의 프로그램끼리 보상을 무작위로 섞으면 성능이 크게 떨어졌다. 연구진은 이 결과를 보상의 분포만으로는 학습 진척을 만들 수 없다는 증거로 제시했다. 직전 한 스텝과만 비교하거나 1차 근사 대신 실제 손실 감소량을 보상으로 쓰면 성능이 떨어졌고, 두 변형은 시드에 따라 결과가 크게 달랐다.5 보상의 부호를 뒤집으면 무작위로 초기화한 모델보다도 나빠졌는데, 연구진은 이를 보상이 전반적으로 더 나은 프로그램을 체계적으로 선호한다는 근거로 해석했다.

실험 설정과 평가 데이터

연구진은 Kim 등(2026)의 스케일링 방법론을 따랐다.6 모델 규모별로 하이퍼파라미터 후보를 기하급수 간격으로 설정했다. 그런 다음 좌표 하강법으로 국소 최적값을 찾았다. 조정한 하이퍼파라미터는 학습자 학습률, 생성자와 학습자의 학습률 비율, 배치 크기, 생성자 KL 정규화 계수 $\beta$의 네 가지다. 학습 목표가 전부 합성 데이터여서 하이퍼파라미터를 고를 기준이 따로 없기 때문에, 모델 선택에는 DCLM과 DNA 검증 손실의 평균을 썼다.7

최대 학습 예산은 343억 6,000만 토큰으로 고정했다. 짧은 워밍업을 마친 뒤에는 학습률을 일정하게 유지했다. 따라서 중간 체크포인트는 각각 해당 토큰 수만큼 학습하고 멈춘 모델과 같다. 따라서 긴 학습 한 번으로 학습 길이를 사후에 최적화할 수 있다. 문맥 길이는 모든 규모에서 4,096 토큰으로 맞췄다. 연구진은 무작위 초기화가 서로 다른 모델을 앙상블하면 도움이 된다는 것을 확인하고, 규모마다 시드 $K$개를 독립적으로 학습시켜 예측 분포를 평균했다.

각 데이터셋과 알고리즘마다 모델 크기, 체크포인트, 앙상블 크기에 대해 연산 최적 프런티어(compute-optimal frontier)를 구성했다. 어떤 설정이 프런티어에 포함되려면, 연산량이 같거나 적은 다른 모든 설정보다 검증 손실이 낮아야 한다. 유효 연산량은 $C = K \times$ 파라미터 수 $\times$ 토큰 수로 계산하고, 프런티어는 다음 식으로 피팅했다.

$$L(C) = E + A\,C^{-\alpha}$$

식의 손실 $L$은 바이트당 비트(bits per byte) 단위로 재며, $E$로는 피팅으로 얻은 점근적 손실 하한을 쓴다.

평가 데이터는 모두 바이트열로 인코딩해 같은 인터페이스를 갖게 했다. 부록 B의 설명을 정리하면 다음과 같다.8

분야데이터바이트 인코딩
텍스트DCLM-Baseline-1.0 웹 텍스트UTF-8 바이트를 그대로 이어 붙임
이미지CIFAR-10 테스트 세트라벨과 메타데이터를 지운 8비트 RGB 픽셀. 채널별 배열과 픽셀별 교차 배열 두 가지
음성Speech Commands v0.02의 1초 녹음16비트 샘플을 부호 없는 1바이트로 양자화. 16kHz, 8kHz, 4kHz 세 가지
음악Mutopia 프로젝트의 서양 고전 40곡 MIDI 선율16분음표 격자마다 음높이(0~127), 지속(128), 쉼(129)
DNAGRCh38 기반 KoLMogorov Test 데이터대문자와 소문자 A, C, G, T의 8개 기호9
형식 수학Metamath set.mm주석을 지운 ASCII 텍스트
코드AITDCC의 C 소스, GitHub Python 소스원본 바이트 그대로

자연 데이터 없이 나타난 스케일링 법칙

셀프 플레이 학습자의 제로샷 손실은 텍스트, 이미지, 음악을 비롯한 여러 모달리티에서 연산량의 거듭제곱 법칙을 따라 줄었다. 이 결과는 모두 평가 데이터셋으로 경사 갱신을 한 번도 하지 않고 얻었다. 아래 표는 논문 Table 2에 나온 모달리티별 연산 지수 $b$를 보여 준다. 셀프 플레이의 지수와 기존 문헌의 사전학습 지수를 함께 적었다. 지수가 클수록 연산량을 늘렸을 때 손실이 빨리 줄어든다.

데이터셀프 플레이 지수문헌의 사전학습 지수10
텍스트(DCLM)0.1230.048~0.099
CIFAR-10(이미지 바이트)0.1450.065~0.10
CIFAR-10(픽셀별 교차 배열)0.066없음
오디오 16비트 PCM0.141없음
오디오 8비트 PCM0.2600.12~0.14
MIDI 선율(Mutopia)0.249없음
Metamath set.mm0.1290.17
DNA(8기호)0.4350.01~0.06
C 소스(AITDCC)0.1160.17
Python 소스(GitHub)0.113없음

논문은 셀프 플레이 지수가 문헌의 사전학습 지수와 대체로 비슷하고 조금 더 높은 편이라고 평가했다. DNA에서는 예외적으로 셀프 플레이 지수가 문헌 값보다 훨씬 크게 나왔다. 연구진은 여러 모달리티의 지수가 이렇게 비슷하게 나오는 현상을, 스케일링의 병목이 우연적 지식보다 보편 구조 학습에 있을 때 기대되는 결과로 설명했다.

셀프 플레이의 효과를 분리하기 위해, 연구진은 똑같은 프로그램 공간을 쓰되 분포가 학습자에 적응하지 않는 기준선과 비교했다. 이 기준선은 종료 토큰이 나올 때까지 명령어를 독립적으로 균일하게 뽑는 고정된 솔로모노프식 사전 분포에서 프로그램을 샘플링한다. 이 분포는 모든 유한 프로그램에 0보다 큰 확률을 주면서도 짧은 프로그램을 선호한다. 두 방법은 계산 가능한 구조의 공간을 똑같이 탐색할 수 있다. 두 방법의 차이는 샘플링 분포가 학습자에 적응하는지 여부에서만 생긴다. Fig. 2에서 이 기준선의 손실은 셀프 플레이보다 훨씬 느리게 줄었다. 연구진은 보편 프로그램 공간에 접근하는 것만으로는 부족하며, 그 공간의 어떤 프로그램에 학습 연산을 배분할지를 셀프 플레이가 학습해야 한다고 결론지었다.

사람이 설계한 합성 데이터와도 비교했다. 무작위로 생성한 확률적 문맥 자유 문법(PCFG)은 언어에 특히 잘 맞는 계층적이고 합성적인 구조를 제공한다.11 PCFG로 사전학습한 모델은 귀납 편향이 잘 맞는 텍스트와 코드에서 셀프 플레이보다 손실이 낮았다. 반면 이미지, 음악, 오디오, 음성에서는 셀프 플레이가 PCFG보다 훨씬 좋았다. 연구진은 특화된 사전 분포가 잘 맞는 분야에서는 셀프 플레이가 그 분포만큼 성능을 내지 못할 때가 있지만, 여러 모달리티에 두루 전이되는 구조를 학습한다고 정리했다.

논문 Fig. 2. 여덟 개 데이터셋별 로그 스케일 그래프로, 가로는 유효 연산량, 세로는 바이트당 비트 손실이다. 위 줄은 이미지(CIFAR-10), 선율(Mutopia), 오디오(MusicNet 44.1kHz), 음성(LibriSpeech PCM8), 아래 줄은 텍스트(DCLM), Python, C 코드, Common Crawl 웹 텍스트다. 청록색 실선의 셀프 플레이는 모든 패널에서 연산량에 따라 꾸준히 손실이 줄고, 주황색 점선의 균일 사전 분포 기준선은 완만하게만 줄어든다. 보라색 점쇄선의 PCFG는 텍스트, Python, C 코드, Common Crawl에서 셀프 플레이보다 낮고 이미지, 선율, 오디오, 음성에서는 높다. Fig. 2. 셀프 플레이, 균일 사전 분포, PCFG 사전학습의 모달리티별 스케일링. 출처: Cowsik et al., arXiv:2609.30063 (2026)

생성자가 찾아낸 수열

생성자는 수학적 규칙이 있는 수열을 출력하는 프로그램을 균일 사전 분포에서 예상한 시점보다 훨씬 빨리 발견했다. 연구진은 이를 셀프 플레이의 성능이 빠르게 개선된 이유 가운데 하나로 들었다. 판별 대상은 등차, 2차, 3차 수열과 피보나치형 수열, 등비수열의 다섯 가지이며, 모두 256으로 나눈 나머지를 기준으로 판별했다.12

수열예시 프로그램출력(mod 256)셀프 플레이 최초 발견 라운드균일 사전 분포의 기대 최초 발견 라운드
등차S+[.++]1, 3, 5, 7, 9, …0약 105
피보나치S,[[.C>.C>]1, 1, 2, 3, 5, …51253,000 초과
등비S+[.L>]1, 3, 9, 27, 81, …25653,000 초과
2차S,.[<C>>VX<RX++]9, 25, 59, 111, …51253,000 초과
3차S+[[-.L>L>-]-]0, 254, 236, 74, …51253,000 초과

균일 사전 분포의 기댓값은 프로그램 1억 6,400만 개를 직접 샘플링하고, 라운드당 프로그램 1,024개를 생성한다고 가정해 환산했다. 등차수열은 1,526번 나와 확률이 9.3×10⁻⁶이었고, 기대 최초 발견 라운드는 약 105였다. 나머지 네 가지는 한 번도 나오지 않았다. 3의 규칙(rule of three)으로 계산하면 확률의 95% 상한은 1.8×10⁻⁸이고, 기대 최초 발견 라운드는 53,000보다 크다. 셀프 플레이에서는 네 가지가 모두 512라운드까지 나타났다. 셀프 플레이 프로그램은 256라운드마다 한 번씩만 저장했으므로, 표의 발견 라운드는 실제 최초 발견 시점보다 늦을 수 있는 보수적인 값이다.

팬시 스티커 화풍의 서소영이 커다란 돋보기를 들고, 작은 민트색 테이프 기계에서 흘러나온 긴 종이 테이프를 들여다본다. 테이프에는 파스텔 점이 한 개, 한 개, 두 개, 세 개처럼 점점 큰 묶음으로 찍혀 있고, 테이프 끝에는 나선 무늬 조개껍데기가 놓여 있다. 학생모 쓴 병아리가 테이프 뒤에서 신기한 듯 고개를 내민다.

연구진은 생성자가 셀프 플레이 동안 점점 더 유용한 데이터를 만드는지도 확인했다. 각 종료 시점 $T$에서 연구진은 그때까지 저장한 생성자 체크포인트 16개로부터 프로그램 419만 개를 균일하게 뽑아 고정 코퍼스를 만들었다. 이어 파라미터 100만 개인 새 학습자를 같은 토큰 예산으로 한 에폭 학습시켰다. 연구진은 먼저 에피플렉시티(epiplexity)로 코퍼스의 품질을 쟀다.13 에피플렉시티는 연산이 제한된 학습자가 데이터에서 추출할 수 있는 구조의 양을 뜻한다. 학습에 쓰지 않은 텍스트, 오디오, 이미지에서의 제로샷 성능도 함께 비교했다.

두 지표 모두 $T$가 커질수록 개선됐다. Fig. 3의 그래프에서 에피플렉시티 평균을 읽어 보면, 학습 전 생성자 $g_0$가 만든 코퍼스의 값은 0에 가깝다. $g_{4096}$이 만든 코퍼스에서는 이 값이 약 1,700으로 늘었다. 같은 구간에서 텍스트 검증 손실이 약 8.4비트에서 5.2비트 안팎으로 가장 크게 줄었다. 이미지 손실은 약 8.6비트에서 6.3비트로 줄었고, 오디오 손실은 약 6.7비트에서 시작해 텍스트와 비슷한 5.2비트 수준에서 멈췄다. 텍스트와 오디오의 손실은 $g_{512}$ 이후 거의 변하지 않았다. 연구진은 나중의 생성자일수록 학습 가능한 구조가 더 많고 전이도 잘 되는 데이터를 만든다고 해석했다. 나중 체크포인트가 앞선 체크포인트의 데이터를 반복하지 않고 커리큘럼에 새로운 구조를 더한다는 뜻이다.

논문 Fig. 3. 두 개의 그래프. 왼쪽 a는 생성자 학습 종료 시점 g0부터 g4096까지 코퍼스의 에피플렉시티로, 시드 8개 평균이 거의 0에서 약 1,700까지 늘고 g4096의 한 시드는 5,001로 표시된다. 오른쪽 b는 같은 시점별로 학습한 학습자의 텍스트, 이미지, 오디오 검증 손실로, 세 곡선 모두 g0에서 g512 사이에 크게 줄고 이후 완만해진다. Fig. 3. 나중 생성자 체크포인트가 만든 코퍼스의 에피플렉시티와 전이 성능. 출처: Cowsik et al., arXiv:2609.30063 (2026)

문맥 내 학습

연구진은 학습자가 경사 갱신이나 미세조정 없이 문맥에 제시된 예시만 보고 과제를 추론하는지도 평가했다. 각 예시는 구분용 바이트 0, 입력 바이트 $k$개, 함숫값 순으로 구성된다. 예시 $m$개를 보여 준 뒤 새 입력을 주고, 모델이 탐욕 디코딩으로 정답 바이트를 출력하는 비율을 잰다. 평가에는 여섯 가지 과제를 썼다.

과제내용
문자열 뒤집기입력 바이트열을 거꾸로 출력
스택푸시(250)와 팝(251) 연산열에서 마지막 팝의 결과
연관 회상먼저 보여 준 키와 값의 사전에서 주어진 키의 값
합두 바이트의 합을 256으로 나눈 나머지
최댓값입력 바이트 $k$개의 최댓값
최솟값입력 바이트 $k$개의 최솟값

예시를 충분히 보여 주자 셀프 플레이 학습자는 문자열 뒤집기, 스택, 연관 회상에서 정답률이 100%에 가까워졌다. 연구진은 세 과제의 성공이 각기 다른 능력을 드러낸다고 설명했다. 연관 회상을 풀려면 문맥을 검색할 수 있어야 하고, 문자열 뒤집기에는 동적 인덱싱이, 스택에는 문맥 자유 문법을 시뮬레이션하는 능력이 필요하다. 학습자는 최댓값, 최솟값, 합처럼 기본적인 수학 관계도 문맥에서 학습했다. 짧은 프로그램은 수학 함수의 적용을 자연스럽게 표현할 수 있으므로, 연구진은 이 과제들을 학습 데이터에 부합하는 시험으로 보았다. 학습자는 최댓값과 최솟값 과제에서 예시를 하나도 보여 주지 않은 상태($m=0$)에서도 6~8%를 맞혔다. 연구진은 이 정답률의 원인을 앞서 나온 토큰을 복사하려는 모델의 사전 경향으로 보았다.

반면 균일 사전 분포나 PCFG로 사전학습한 모델은 이 과제들을 모두 학습하지 못했다. 균일 사전 분포 모델에서는 문맥 내 학습의 흔적을 거의 찾을 수 없었고, PCFG 모델은 연관 회상에서만 강했으며 나머지 과제로는 거의 전이되지 않았다.

논문 Fig. 4. 세 개의 패널로 구성된 로그 스케일 그래프. 가로는 문맥 내 예시 수 m, 세로는 정확 일치 정답률이다. 왼쪽 셀프 플레이 패널에서는 여섯 과제 곡선이 예시가 늘수록 모두 올라가 대부분 1.0 근처에 이르고, 합 과제는 가장 느리게 오른다. 가운데 균일 사전 분포 패널은 거의 모든 곡선이 0에 머문다. 오른쪽 PCFG 패널은 연관 회상만 1.0 가까이 높고 나머지는 0.2 이하다. Fig. 4. 사전학습 방법별 문맥 내 학습 성능. 출처: Cowsik et al., arXiv:2609.30063 (2026)

연구진은 합 과제에서 예시가 늘어남에 따라 모델의 전략이 어떻게 바뀌는지도 분석했다. 처음에 모델은 사전 분포에서 가장 흔한 바이트(0, 255, 1, 16)를 출력한다. 예시를 몇 개 보면 문맥에 나온 바이트를 복사하기 시작한다. 그러나 높은 확률로 예측한 바이트가 몇 차례 틀리면, 모델의 예측 확률은 여러 바이트에 분산된다. 이때 예측 엔트로피는 8비트 가까이 오른다. 예시가 4개쯤 되면 하위 4비트를 정확히 더하기 시작하고, 8개쯤부터는 상위 4비트도 맞히기 시작한다. 그 뒤로 모델은 올바른 전략에 대한 확신을 높여 가며 그 전략을 고수한다.

논문 Fig. 5. 두 개의 그래프. 왼쪽 a는 합 과제 1,024회 시행에서 모델 출력을 범주별 비율로 쌓은 면적 그래프로, 예시가 적을 때는 선호 바이트(0, 255, 1, 16)가 대부분이고, 예시 4개에서 16개 사이에 기타 출력이 크게 늘었다가, 이후 하위 4비트만 맞는 출력과 정답 출력이 늘어 예시 512개에서는 정답이 약 87%를 차지한다. 오른쪽 b는 같은 구간의 예측 엔트로피로, 8비트 가까이 올랐다가 예시 64개 이후 약 5비트까지 떨어진다. Fig. 5. 합 과제에서 예시 수에 따라 바뀌는 모델의 전략과 예측 엔트로피. 출처: Cowsik et al., arXiv:2609.30063 (2026)

보편 구조와 우연적 정보로 설명한 스케일링 법칙

실험 결과는 두 가지로 요약된다. 학습자는 자연 데이터를 전혀 학습하지 않았는데도, 자연 데이터에 대한 예측 성능을 거듭제곱 법칙에 따라 개선했다. 관측된 스케일링 지수도 해당 분야의 표준 사전학습 지수와 비슷했다. 연구진은 자연 데이터에 보통 함께 포함된 두 가지 예측 정보를 구분해 이 결과를 설명했다. 우연적 정보는 데이터를 생성한 특정 세계나 분포에만 해당하는 정보를 가리킨다. 반면 보편 예측 구조는 여러 데이터 생성 과정이 공유한다.

친칠라 논문(Hoffmann 등, 2022)은 손실을 모델 크기 $N$과 자연 데이터 양 $D$의 함수로 모델링했다. 연구진은 여기서 데이터 항을 우연적 정보의 유효량 $D_c$와 보편 구조의 유효량 $D_u$로 분해했다.

$$L = E + \frac{A}{N^{\alpha}} + \frac{B}{D_c^{\beta}} + \frac{C}{D_u^{\gamma}}$$

셀프 플레이 학습자는 자연 데이터를 한 번도 학습하지 않는다. 따라서 우연적 정보의 양 $D_c$는 학습 내내 변하지 않는다. 연구진은 셋째 항을 데이터셋별 상수 $E'$에 포함시키고, 셀프 플레이로 생성한 보편 구조 $D_u(T)$만 늘어난다고 보았다. 셀프 플레이가 보편 구조를 거듭제곱 속도로 생성한다면, 다시 말해 $D_u(T) \propto T^{\eta}$라면 손실은 다음과 같다.

$$L = E' + \frac{A}{N^{\alpha}} + \frac{C'}{T^{\gamma\eta}}$$

이 식은 자연 데이터를 추가하지 않아도 자연 데이터 손실이 셀프 플레이 학습량 $T$의 거듭제곱 법칙으로 줄어들 수 있다고 예측한다. 대신 줄일 수 없는 오차가 더 크다.

표준 사전학습에서는 자연 데이터를 늘리면 두 자원이 함께 늘어난다. $D_c \propto D^{\nu}$, $D_u \propto D^{\mu}$로 두면 데이터 항이 두 개의 거듭제곱 항이 되고, 점근적으로는 더 느리게 줄어드는 항이 손실을 결정한다. 데이터 지수를 하나만 두고 피팅했을 때 관측되는 값은 두 지수 중 작은 값인 $\beta_{\mathrm{obs}} \approx \min\{\beta\nu, \gamma\mu\}$에 가까워진다. 셀프 플레이 지수는 $\gamma\eta$의 추정값인데, 이 값이 자연 데이터 사전학습 지수와 비슷하게 나왔다. 셀프 플레이는 보편 구조로만 개선될 수 있고 자연 데이터 사전학습은 두 정보 모두로 개선될 수 있으므로, 연구진은 두 지수의 비교에 의미가 있다고 보았다. 이를 근거로 연구진은 자연 데이터 스케일링에서 얻는 개선의 중요한 부분이 보편 구조 학습에서 나올 수 있다고 조심스럽게 해석했다.

연구진은 보편 사전학습이 우연적 정보를 복원할 수는 없다는 점도 분명히 했다. 특정 세계에 관한 지식은 그 세계와 상호작용해야만 얻을 수 있다. 따라서 논문은 보편 사전학습을 자연 데이터의 대체재로 보지 않고, 보편 구조를 분리해 그 구조를 연산으로 생성할 수 있는지 연구하는 방법으로 제시했다.

팬시 스티커 화풍의 서소영이 유리병 두 개 사이에 서 있다. 서소영은 작은 국자로 파스텔 구슬을 뚜껑 없는 왼쪽 병에 부어 넣고, 그 병에는 한 쌍의 하트, 쌓인 블록, 겹친 고리, 나선 같은 무늬 도형이 들어 있다. 오른쪽 병에는 지도, 고양이 사진, 나뭇잎, 찻잔 같은 일상 물건이 들어 있고 뚜껑과 리본으로 단단히 봉해져 있다. 학생모 쓴 병아리가 봉해진 오른쪽 병을 두드리며 갸웃한다.

이 분해는 최근의 합성 데이터 연구를 해석하는 틀로도 쓰인다. 추상적, 형식적, 절차적 데이터처럼 분야와 무관한 데이터는 $D_u$를 늘린다. 고정된 자연 코퍼스를 다르게 표현하거나, 그 코퍼스에서 문서 사이의 관계나 잠재 추론 과정을 생성하는 방법은 코퍼스에 이미 있는 정보를 더 효율적으로 습득하게 하므로 $D_c$를 늘리는 효과가 있다. 연구진은 사고 연쇄 기반 방법이 재사용 가능한 구조도 추가하므로 $D_u$에도 영향을 줄 수 있다고 덧붙였다. 이 틀을 따르면, 합성 데이터가 목표 분포와 겉모습이 전혀 달라도 사전학습에 도움이 되는 이유를 설명할 수 있다. 보편 구조가 부족한 상황에서는 구조를 갖춘 경험을 추가로 생성하는 것이 예측을 개선하고, 우연적 정보가 부족한 상황에서는 고정 코퍼스를 합성적으로 변형해 관측 하나에서 얻는 학습 신호를 늘릴 수 있다. 이 논문의 실험은 이 설계 공간에서 극단적인 경우에 해당한다. 학습 중 $D_c$는 0으로 고정되고, 학습 시스템은 늘어나는 연산을 모두 $D_u$를 찾는 데 쓴다.

자연 데이터 사전학습의 초기값으로 쓴 결과

부록 A.1은 셀프 플레이로 얻은 구조가 자연 데이터를 쓸 수 있게 된 뒤에도 유용한지를 확인한다. 연구진은 셀프 플레이 학습자를 일반 사전학습의 초기값으로 쓰는 사전 사전학습(pre-pretraining)을 시험했다. 실험에서는 파라미터 2,440만 개 모델의 초기값으로 무작위 가중치 또는 마지막 셀프 플레이 체크포인트를 사용했다. 이후 두 조건에서 DCLM 텍스트, CIFAR-10 이미지, ESC-50 오디오로 각각 수렴할 때까지 학습시켰다. 학습률과 가중치 감쇠는 두 조건마다 따로 조정했고, 시드는 조건마다 4개씩 썼다.

셀프 플레이로 초기화한 모델은 처음부터 손실이 낮았고, 학습 내내 같은 손실 수준을 더 적은 자연 데이터 토큰으로 달성했다. 수렴할 때까지 ESC-50에서는 셀프 플레이 초기화 모델이 3억 2,000만 토큰, 무작위 초기화 모델이 4억 9,600만 토큰을 썼다. CIFAR-10에서는 각각 4억 2,100만 토큰과 5억 8,800만 토큰을 썼다. 학습이 끝날 무렵에는 두 조건의 손실 차이가 상당히 줄었으므로, 연구진은 사전 사전학습의 가장 뚜렷한 이점이 자연 데이터 학습을 빠르게 하는 데 있다고 정리했다.14

논문 Fig. 6. DCLM 텍스트, CIFAR-10 이미지, ESC-50 오디오 세 패널의 학습 곡선. 가로는 자연 데이터 토큰 수(백만 개, 로그 스케일), 세로는 검증 손실이다. 파란 실선의 무작위 초기화는 약 8.6비트에서 시작하고, 주황 점선의 셀프 플레이 초기화는 텍스트 약 5.7비트, 이미지 약 6.3비트, 오디오 약 5.3비트에서 시작해 학습 내내 파란 선보다 낮다. 각 패널 오른쪽 아래의 수렴 표시는 주황 선의 모델이 더 적은 토큰에서 수렴했음을 나타낸다. Fig. 6. 셀프 플레이 체크포인트로 초기화한 자연 데이터 사전학습. 출처: Cowsik et al., arXiv:2609.30063 (2026)

논문이 밝힌 한계와 다음 과제

실험한 모델은 모두 파라미터가 2,500만 개보다 적었고, 문맥 길이는 4,096 토큰이었다. 연구진은 이 결과가 더 큰 모델에서도 유지되는지를 가장 먼저 풀어야 할 질문으로 꼽았다. 규모를 늘리려면 표현력이 더 높은 프로그래밍 언어가 필요할 수 있다. 그 언어에서는 재사용 가능한 추상화가 생성자와 함께 발전할 수 있어야 한다. 프로그램 탐색 효율과 전반적인 확장성을 개선하는 일도 과제로 남아 있다. 생성자가 발견한 수학 구조가 전이의 실제 원인인지도 아직 검증하지 않았다. 이 인과 관계는 회로 분석이나 커리큘럼 절제 실험으로 검증할 수 있다고 한다.

연구진은 백지 조건을 통제된 과학 실험을 위해 택했으며, 모델을 사전학습하는 가장 실용적인 방법으로 제시하지는 않았다고 밝혔다. 실제로는 셀프 플레이를 무작위 초기화에서 시작할 필요가 없다. 연구진이 중요하게 보는 질문은 자연 데이터를 구하는 비용이 커지거나, 데이터가 중복되거나, 고갈된 뒤에도 스스로 생성한 경험이 모델의 능력을 계속 향상시킬 수 있는가이다. 무작위 초기화 상태에서 적응형 커리큘럼이 전이 가능한 구조를 만들어 냈다는 점을 근거로, 연구진은 이미 학습된 모델에서 출발할 때도 같은 방식이 유용할 수 있다고 보았다. 그렇게 되면 셀프 플레이는 표준 사전학습을 보완하는 방법이 될 수 있다.

노이즈를 만들지 않는 생성자

논문을 읽는 내내 한 가지가 궁금했다. 생성자는 왜 무작위 노이즈 프로그램만 만들지 않는가. 예측하기 어려운 데이터에 보상을 주는 방식에는 허점이 있다. 학습자가 결코 맞힐 수 없는 무작위 바이트만 내보내도 생성자는 가장 높은 보상을 받는다. 연구진도 처음 검토한 보상에서 이 문제를 겪었다고 밝혔다. 최종 보상은 새 데이터가 얼마나 어려운지를 묻지 않고, 새 데이터의 경사가 지난 구간 동안 학습자의 파라미터가 변해 온 방향과 일치하는지를 묻는다. 무작위 바이트에서 나온 경사는 어느 한 방향으로 누적되지 않으므로 이 기준으로는 보상을 받지 못한다. 같은 풀의 프로그램끼리 보상을 섞은 절제 실험에서 성능이 크게 떨어졌다는 결과를 보면, 생성자는 이 신호를 프로그램 하나하나의 가치를 판별하는 데 실제로 활용하고 있다.

균일 분포에서 프로그램을 1억 6,400만 개 뽑았을 때는 피보나치 수열이 한 번도 나오지 않았다. 셀프 플레이 생성자가 이 수열을 찾아낸 시점은 512라운드 이전이었다. 두 방법에 주어진 프로그램 공간은 똑같았다. 생성자가 학습한 내용은 새로운 명령어가 아니었다. 생성자는 학습자의 진척을 기준으로, 그 공간에서 어떤 프로그램을 먼저 시도할지를 학습했다. 논문 첫머리에 인용한 세네카의 문장 “가르치면서 배운다(By teaching, we learn)“는 학습자를 가르치는 생성자가 그 과정에서 무엇을 가르칠지를 배우는 이 구조와 잘 들어맞는다.

출처

Aditya Cowsik, Kfir Dolev, Michael Y. Li, G. Bruno De Luca, Nourya Cohen, Noah D. Goodman, Yoav Levine, 「Self-Play Pretraining with Zero Data」, arXiv:2609.30063 [cs.AI], 2026년 9월 24일 제출(v1).

원문: https://arxiv.org/abs/2609.30063

논문 그림(Fig. 1~6)은 원문의 HTML판에서 인용했다. 커버와 본문의 팬시 서소영 삽화 다섯 장은 별도로 생성했다.15


  1. 리치 서튼(Rich Sutton)이 2019년에 쓴 글이다. 사람이 설계한 지식을 넣는 방법보다 연산량이 늘어날수록 성능이 오르는 범용 방법이 장기적으로 더 좋은 성과를 냈다고 주장한다. ↩︎

  2. Grau-Moya 등(2024)의 「Learning universal predictors」는 만능 튜링 기계에서 샘플링한 프로그램의 출력으로 신경망을 학습시키면 보편 예측을 근사할 수 있음을 보였다. 이 논문은 프로그램 분포를 고정하지 않고 학습자와 함께 학습한다는 점에서 다르다. ↩︎

  3. 변이 프로그램은 보상이 양수였던 프로그램을 보관하는 MAP-Elites식 아카이브에서 부모를 골라, 토큰 하나를 바꾸거나 넣거나 지워서 만든다. 아카이브는 최대 반복문 깊이(0~8)와 프로그램 길이(8, 16, 32 토큰 기준 구간)로 최대 36개 칸을 구성하고, 칸마다 보상 상위 8개 프로그램을 유지한다. 저장된 보상은 라운드마다 0.97배로 감쇠한다. 재생 프로그램은 새 무작위 테이프로 다시 실행한다. ↩︎

  4. 보상 가중 지도 미세조정은 양수 보상을 풀 전체의 합으로 정규화한 가중치로 각 프로그램의 로그 가능도를 학습하며, 계수 $\lambda_{\mathrm{EI}}$는 1.0이다. 시퀀스 단위 중요도 비율은 $e^{-20}$에서 $e^{20}$ 사이로 잘라서 쓴다. ↩︎

  5. 두 변형은 시드마다 결과가 두 집단으로 뚜렷하게 구분됐다. 예를 들어 직전 1스텝 비교의 DCLM 단일 시드 손실은 6.4, 6.5와 10.6, 11.1이었다. 표의 값은 발산한 시드까지 포함한 앙상블이다. ↩︎

  6. Kim, Kotha, Liang, Hashimoto, 「Pre-training under infinite compute」, ICLR 2026. ↩︎

  7. 이 선택 과정에서 자연 데이터의 정보가 일부 반영된다. 연구진은 이 누출을 인정하면서, 경사 갱신에는 자연 데이터를 한 번도 쓰지 않았다고 밝혔다. ↩︎

  8. 부록 B는 음성 벤치마크로 Speech Commands를 설명하지만, Fig. 2의 패널 제목에는 오디오가 MusicNet 44.1kHz, 음성이 LibriSpeech PCM8로 적혀 있다. ↩︎

  9. 8개 값에 확률을 균등하게 주면 손실은 바이트당 3비트이고, 학습자의 출력 공간인 256개 값 전체에 균등하게 주면 8비트다. ↩︎

  10. 문헌 값 가운데 일부는 발표된 친칠라 형식의 피팅에서 연산 최적 배분을 가정해 $b = \alpha\beta/(\alpha+\beta)$로 환산한 값이다. 범위로 적은 값은 인용한 논문마다 다르게 보고된 값이다. ↩︎

  11. 문법마다 종단 기호 2~16개와 비종단 기호 1~8개를 무작위로 정하고, 비종단 기호마다 생성 규칙을 1~4개 둔다. ↩︎

  12. 구조가 시작되기 전의 무관한 앞머리 바이트는 30개까지 허용한다. 나머지 테이프 전체가 해당 점화식을 256으로 나눈 나머지 기준으로 만족해야 하고, 수열의 끝부분이 상수로 이어지는 퇴화 사례를 거르기 위해 최소 주기가 30 이상이어야 한다. 여러 조건을 동시에 만족하면 가장 낮은 차수의 수열로 분류한다. ↩︎

  13. Finzi 등(2026)의 「From entropy to epiplexity」가 정식화한 척도다. 엔트로피나 콜모고로프 복잡도처럼 연산 제약이 없는 척도로는 창발적 구조를 포착하지 못한다는 문제의식에서 나왔다. 이 실험에서는 학습자가 수렴하기 전까지 누적한 초과 학습 손실로 측정했다. ↩︎

  14. 이 비교에는 셀프 플레이 자체에 든 연산량을 포함하지 않았다. 연구진에 따르면 셀프 플레이 비용은 한 번만 든다. 이번 실험에서도 체크포인트 하나로 세 모달리티의 학습을 모두 초기화했다. 연구진은 이를 사전학습 체크포인트를 여러 미세조정 과제에 재사용하는 경우와 같다고 설명했다. ↩︎

  15. 「서소영 옷장」 페이지의 기본 한복 그림을 참조 이미지로 삼아 gpt-image-2.5-flare image-to-image로 생성했다. 학생모를 쓴 병아리는 학습자 모델을 나타낸다. ↩︎