3줄 요약

  1. 칭화대와 스탠퍼드대의 연구자 세 사람이 2026년 2월 1일 arXiv에 이 논문을 올리고 5월 11일에 개정했다. LLM의 히든 스테이트가 보상 관련 정보를 담고 있다는 관찰은 이미 나와 있었다. 이 논문은 그 정보가 뉴런들 사이에 어떤 형태로 분포하는지를 직접 다룬다.
  2. 연구진은 이렇게 답한다. 보상 정보는 전체 뉴런의 1%에도 미치지 못하는 극소수 뉴런에 몰려 있으며, 그 극소수는 다시 두 종류로 구분된다. 하나는 현재 상태의 기대 가치를 예측하는 가치 뉴런(value neuron)이고, 다른 하나는 추론 한 단계마다 발생하는 시간차 오차를 담는 도파민 뉴런(dopamine neuron)이다.
  3. 이 뉴런들의 위치는 데이터셋과 모델을 바꾸어도 상당 부분 유지되었다. 연구진은 두 가지 응용을 함께 보였다. 가치 뉴런은 모델이 답을 쓰기 전에 확신도를 예측하는 과제에서 평균 AUC 0.67로 모든 비교군을 앞섰고, 도파민 뉴런은 과정 보상 모델로 쓰여 MATH500 정확도를 72.2%에서 77.8%로 올렸다.

기존 연구와 무엇이 다른가

LLM의 히든 스테이트는 정답 여부나 모델의 확신도 같은 보상 관련 정보를 품고 있다. 이 발견은 이미 여러 갈래로 보고되어 있다. 연구진은 그 다음 단계를 문제로 삼았다. 지금까지의 연구는 히든 스테이트 전체를 입력으로 받는 블랙박스 프로브를 학습시켜 “정보를 꺼낼 수 있다"는 점만 보여 주었고, 그 정보가 뉴런들 사이에 어떻게 조직되어 있는지는 말해 주지 못했다.

연구진은 이 물음이 두 방향에서 중요하다고 했다. 기계적 해석 가능성의 관점에서는 보상 신호가 희소하게 부호화되어 있는지 여부가 밝혀지고, 실용의 관점에서는 보상을 담당하는 뉴런의 최소 집합을 찾아내면 훨씬 가볍고 표적이 분명한 응용을 만들 수 있다.

두 뉴런 유형의 이름은 신경과학에서 빌려 왔다. 생물의 보상 체계에서도 가치 뉴런은 자극의 주관적 가치를 표상하고 도파민 뉴런은 보상 예측 오차를 부호화한다. 연구진은 LLM에서 찾아낸 두 집합이 각각 그와 같은 역할을 맡는다고 비유했다.

왜 보상 정보가 희소하리라고 예상했는가

연구진은 본격적인 실험에 앞서 두 가지 동기를 제시한다. 이들 스스로도 이것이 엄밀한 증명은 아니고 동기 부여에 가깝다고 밝혔다.

첫째, 왜 자기회귀 LLM 안에 가치와 시간차 오차를 예측하는 뉴런이 있을 법한가. 자기회귀 LLM을 부분적인 추론 궤적 위의 정책으로 본다면, 어떤 중간 상태의 가치는 그 지점에서 생성을 이어 갔을 때 결국 정답에 이를 기대 확률로 정의할 수 있다.

$$ V^{\mathcal{M}}(s_t) = \mathbb{E}_{\mathcal{M}}\left[\, r(s_T) \mid s_t \,\right] $$

최대 엔트로피 강화학습에서는 최적 정책의 로그 확률이 소프트 Q 함수와 가치 함수의 차이로 표현된다. 정책이 우수할수록 가치 함수와 밀접하게 연결되어 있다는 뜻이므로, 강력한 정책 모델인 LLM의 내부 표현 역시 가치 정보를 담고 있으리라고 기대할 수 있다.

둘째, 왜 그 정보가 소수의 뉴런에 몰려 있을 법한가. 연구진은 가능성과 실현을 구분해 설명한다. 가능성 쪽에서는 정보 이론을 든다. 이진 보상을 예측하는 데 필요한 정보는 베이즈 정리에 따라 로그 우도비라는 스칼라 하나로 요약되므로, 원리상 소수의 좌표만으로도 충분하다. 시간차 오차 역시 스칼라이므로 같은 논리가 적용된다. 실현 쪽에서는 중첩 가설1을 든다. 이 가설에 따르면 학습 과정에서 자주 등장하고 중요도가 높은 특징일수록 전용 뉴런을 배정받는다. 가치와 시간차 오차는 추론 내내 유용한 정보이므로, 이 가설은 두 정보가 희소한 전용 표현을 얻었으리라고 예측한다.

가치 뉴런: 1% 미만으로도 정답 여부를 맞힌다

연구진은 히든 스테이트에서 가치 정보를 꺼내기 위해 ReLU를 쓰는 2층 MLP 프로브를 학습시켰다. 입력 차원은 대상 층의 히든 스테이트 차원과 같고 출력은 스칼라 하나다. 학습은 최종 보상만 맞히는 방식 대신 시간차 학습으로 진행한다.

평가는 생성이 시작되기 전인 입력 위치에서 이루어진다. 연구진은 모델이 답을 한 글자도 쓰기 전에 이미 최종 정답 여부를 가늠하고 있는지 보려고 이 지점을 골랐다. 예측값과 실제 최종 보상 사이의 AUC2를 지표로 삼았다.

희소성은 가지치기 실험으로 확인했다. 입력 차원별로 첫 은닉층에 연결되는 가중치의 L1 노름을 계산해, 값이 작은 차원부터 순서대로 잘라 낸다. 그리고 남은 차원만으로 다시 예측하게 한다. 가지치기 비율을 올려도 AUC 곡선이 크게 낮아지지 않는다면, 남아 있는 소수의 뉴런이 가치 정보를 지탱하고 있다는 증거가 된다.

Qwen-2.5-14B-SimpleRL-Zoo 모델의 2번에서 4번 층을 GSM8K와 MATH500으로 시험한 결과, AUC 곡선은 뚜렷하게 떨어지지 않았다. 전체 뉴런의 1%에 못 미치는 뉴런만으로도 가치 예측이 유지되었다. 연구진은 이 뉴런들을 가치 뉴런이라고 이름 붙였다.

같은 현상은 과제와 모델을 바꾸어도 나타났다. 데이터셋으로는 MATH500과 ARC에 더해 코딩 과제인 MBPP+와 지시 따르기 과제인 IFEval까지 시험했다. 모델로는 Qwen3.5-0.8B, Phi-3.5-mini-instruct, Llama-3.1-8B-Instruct, Qwen-2.5-14B-SimpleRL-Zoo에서 같은 결과를 얻었다.

한 가지 덧붙일 것이 있다. 생성 이전 위치에서의 예측은 원래 어려운 과제라 AUC의 절대값이 높지 않다. 연구진이 부록에서 응답이 끝난 마지막 토큰 위치로 평가 지점을 옮겨 보니, AUC는 넓은 가지치기 구간에서 0.8 이상을 유지했다.

개입 실험: 이 뉴런들은 보상에만 관여하는가

가지치기 실험은 상관을 보여 줄 뿐이다. 그래서 연구진은 Qwen-2.5-7B-SimpleRL-Zoo 모델에서 특정 층의 상위 1% 가치 뉴런의 활성을 0으로 만들고, MATH500 정확도가 얼마나 떨어지는지 측정했다. 이 모델은 개입을 받기 전에 MATH500에서 75.2%를 기록했다.

층가치 뉴런무작위NTP 뉴런MagnitudeWanda
237.0 (-38.2)77.0 (+1.8)76.4 (+1.2)74.6 (-0.6)74.8 (-0.4)
313.6 (-61.6)73.4 (-1.8)76.8 (+1.6)61.6 (-13.6)48.2 (-27.0)
429.4 (-45.8)73.8 (-1.4)77.4 (+2.2)75.4 (+0.2)67.0 (-8.2)
51.2 (-74.0)74.4 (-0.8)75.2 (+0.0)75.0 (-0.2)73.4 (-1.8)
평균20.3 (-54.9)74.6 (-0.6)76.4 (+1.2)71.6 (-3.6)65.8 (-9.4)

각 칸은 개입 후의 MATH500 정확도이고, 괄호 안은 개입 전 정확도 75.2%와의 차이(%p)다.

가치 뉴런을 껐을 때 정확도는 평균 54.9%p 낮아졌다. 이 폭은 가중치 크기를 기준으로 고른 Magnitude나 Wanda로 뉴런을 껐을 때보다 훨씬 컸다. 이 대비 때문에, 연구진이 구조적으로 중요한 뉴런을 우연히 골라냈을 뿐이라고 보기는 어렵다. 여러 비교군 가운데 NTP 뉴런의 결과가 특히 중요하다. 보상과 무관한 목표인 다음 토큰 예측으로 같은 구조의 프로브를 학습시키고, 여기서 뽑아낸 상위 1%를 껐더니 성능에 아무런 손상이 없었다. 두 집합의 겹침은 0.7%에 그쳤다. 무작위로 골랐을 때의 기대 겹침이 0.5%이므로 거의 겹치지 않은 셈이다.

연구진은 학습 목표를 바꾼 대조 실험도 제시했다. 시간차 오차 대신 최종 보상만으로 프로브를 학습시켜 뽑아낸 상위 1%를 껐을 때 평균 정확도는 66.4%에 머물렀다. 같은 1%라도 시간차 학습으로 찾아낸 위치가 추론 능력에 훨씬 결정적으로 작용했다.

데이터셋과 모델이 달라져도 위치는 유지된다

가치 뉴런이 모델의 고유한 성질이라면 그 위치도 과제에 따라 흔들리지 않아야 한다. 연구진은 서로 다른 두 데이터셋에서 각각 찾아낸 가치 뉴런 집합의 IoU를 계산하고, 무작위로 뽑았을 때의 기댓값과 비교했다.

연구진은 Qwen-2.5-14B-SimpleRL-Zoo의 3번 층에서 GSM8K, MATH500, ARC를 둘씩 짝지어 IoU를 계산했다. 이 IoU는 모든 구간에서 무작위 기준선을 넘었고, 가지치기 비율이 1에 가까워질수록 급격히 올라갔다. 가장 중요한 소수의 가치 뉴런일수록 과제가 바뀌어도 같은 위치에서 발견된다.

같은 베이스 모델에서 파생된 모델들 사이에서도 위치는 보존되었다. Qwen-2.5-7B에서 각각 다른 방식으로 후속 학습된 Qwen-2.5-7B-SimpleRL-Zoo와 Qwen2.5-7B-PPO-Zero를 비교했을 때, IoU는 무작위 기준선 위에 머물렀다.

도파민 뉴런: 한 단계의 예측 오차를 담는다

두 번째 뉴런 집합은 추론이 진행되는 동안의 변화를 다룬다. 연구진은 모델의 응답을 문단 단위로 구분하고, 각 문단 경계에서 몬테카를로 방식으로 여러 번 롤아웃을 돌려 그 지점의 가치를 추정한다. 이웃한 두 문단 경계의 가치 차이가 그 문단의 시간차 오차다.

$$ \delta_t = \gamma\, \hat{V}(s_t) - \hat{V}(s_{t-1}) $$

값이 양수면 그 문단이 정답에 이를 확률을 높였다는 뜻이고, 음수면 추론을 나쁜 쪽으로 끌고 갔다는 뜻이다. 학습과 평가는 오차의 절댓값이 0.3을 넘는 문단만 사용했다. 이 조건으로 보상 변화가 실제로 일어난 지점에 집중했다.

도파민 프로브는 가치 프로브와 같은 구조를 쓰되 은닉 차원이 훨씬 작다. 가치 프로브의 은닉 차원은 1024이고, 도파민 프로브의 은닉 차원은 32다. 히든 스테이트는 응답 구간 안에서 토큰 축을 따라 z 점수로 정규화한 뒤 문단 단위로 평균을 낸다. 생물의 도파민 반응은 일정한 시간 창의 평균 발화율로 측정한다. 연구진은 이 처리를 거기에서 따왔다.

평가에는 예측값과 몬테카를로로 추정한 시간차 오차 사이의 스피어만 상관3을 썼다. Qwen-2.5의 7B와 14B SimpleRL-Zoo 모델을 MATH500으로 시험한 결과, 상관 계수는 넓은 가지치기 구간에서 거의 변하지 않았다. 단계별 예측 오차를 알리는 정보 역시 희소한 뉴런 집합에 모여 있다.

활성 곡선은 무엇을 그리는가

연구진은 5번 층의 1517번 뉴런 하나를 골라 활성 곡선을 그려 보였다. 그 결과를 커버 이미지의 두 사례가 보여 준다.

왼쪽의 긍정적 놀라움 사례에서 모델은 처음에 문제를 풀 자신이 없었으나 끝내 정답에 도달한다. 뉴런의 활성은 결정적인 논리 단계를 찾아낸 지점에서 한 번, 최종 핵심 결과를 끌어낸 지점에서 한 번 치솟는다. 오른쪽의 부정적 놀라움 사례에서는 반대 장면이 나온다. 모델은 높은 확신으로 출발했다가 중간에 오류를 저지르는데, 뉴런의 활성은 논리적 결함이 발생한 바로 그 지점에서 뚜렷하게 낮아진다.

Minerva Math 데이터셋에서 같은 5번 층 1517번 뉴런의 활성 곡선을 다시 그린 결과. 200번째 토큰 근처에서 핵심 결론을 끌어낼 때 활성이 급등하고, 300번째 토큰과 400번째 토큰 사이에서 오류를 범할 때 활성이 억제된다. 출처: arXiv:2602.00986 Figure 9.

같은 성질은 Minerva Math 데이터셋에서도 재현되었다. 각 층에서 상위 50개를 도파민 뉴런으로 골랐더니 MATH500에서 찾아낸 집합과 상당 부분 겹쳤고, 5번 층의 1517번 뉴런도 여전히 그 안에 들어 있었다.

두 집합은 하나의 체계로 묶인다

연구진은 가치 뉴런과 도파민 뉴런이 서로 무관한 두 발견에 그치지 않는다는 근거도 제시한다. 앞쪽 층의 가치 뉴런 활성을 0으로 만든 뒤, 뒤쪽 층에 있는 도파민 뉴런의 활성 궤적이 어떻게 달라지는지를 관찰하는 실험이다.

같은 도파민 뉴런의 활성 곡선을 세 조건에서 겹쳐 그린 그림. 노란 선은 원래 궤적이고, 파란 선은 무작위 뉴런 20%를 껐을 때이며, 빨간 선은 상위 20% 가치 뉴런을 껐을 때다. 무작위 제거는 곡선의 흐름을 거의 바꾸지 않지만 가치 뉴런 제거는 봉우리와 골의 위치를 크게 바꾸어 놓는다. 출처: arXiv:2602.00986 Figure 10.

같은 개수의 뉴런을 무작위로 껐을 때는 곡선이 원래 궤적에서 거의 벗어나지 않았다. 반면 상위 20% 가치 뉴런을 껐을 때는 봉우리와 골의 위치가 크게 어긋났고, 그 뉴런은 예측 오차를 부호화하는 성질을 잃어버렸다. 연구진은 이를 두 집합이 보상 신호를 중심으로 기능적으로 맞물린 하나의 체계라는 증거로 본다.

정리하면 개입 실험은 세 가지를 보여 준다. 첫째는 가치 뉴런이 추론 성능에 결정적이라는 필요성이다. 둘째는 가치 뉴런이 보상 신호에만 특별히 연관되어 있다는 특이성이다. 셋째는 앞쪽 층을 건드리면 뒤쪽 층의 보상 체계까지 손상된다는 기능적 일관성이다.

응용 1: 답을 쓰기 전에 확신도를 잰다

가치 뉴런은 응답 토큰이 하나도 나오기 전에 이미 가치 정보를 담고 있으므로, 가벼운 확신도 추정기로 쓸 수 있다. 연구진은 실용적 이점도 덧붙였다. 요즘 추론 모델은 응답이 대단히 길어지기 때문에, 미리 확신도를 가늠할 수 있으면 그에 맞추어 연산 예산을 다르게 배정하는 전략이 가능해진다.

연구진은 비교군 네 가지를 세웠다. 히든 스테이트 전체에 선형 프로브를 학습시키는 LCD, 모델에게 확신도를 직접 말하게 하는 방식, 질문 위치에서 다음 토큰의 로그 확률을 쓰는 방식, 그리고 질문 길이를 단순 대리 지표로 쓰는 방식이다.

방식평균 AUC
가치 뉴런0.67
질문 길이0.62
LCD0.60
모델이 말한 확신도0.52
토큰 로그 확률0.48

위 값은 네 모델(Llama-3.1-8B, Phi-3.5-mini, Gemma-3-4B, Qwen3.5-0.8B)과 두 벤치마크(MATH500, ARC)에서 얻은 AUC를 평균한 것이다. 가치 뉴런이 가장 높았고, 히든 스테이트 전체를 쓰는 LCD보다 훨씬 적은 차원만으로 그 성적을 냈다. 모델에게 확신도를 직접 물어보는 방식과 토큰 로그 확률은 질문 길이라는 소박한 대리 지표에도 미치지 못했다.

응용 2: 내부에서 나온 과정 보상 모델

도파민 뉴런은 단계별 예측 오차를 담고 있으므로, 그 활성을 그대로 각 추론 단계의 점수로 쓸 수 있다. 연구진은 문단 경계마다 후보 응답 4개를 생성했다. 그리고 프로브가 매긴 점수가 가장 높은 후보를 다음 단계로 채택하는 방식으로 탐색을 안내했다.

방식MATH500 정확도
탐욕적 디코딩72.2%
무작위 선택72.2%
암묵적 PRM75.0%
도파민 뉴런77.8%

표의 값은 Qwen-2.5-7B-SimpleRL-Zoo 모델과 MATH500 검증 부분집합에서 난수 시드 세 개로 얻은 결과의 평균이다. 암묵적 PRM은 KL 제약 강화학습의 이론적 결과에 기댄다. 강화학습 모델과 베이스 모델의 로그 확률 차이를 단계 보상의 근사로 쓰는 방식이다. 연구진은 별도의 보상 모델을 붙이지 않고 모델 자신의 뉴런 활성만으로 정확도를 5.6%p 끌어올렸다.

저자들이 밝힌 한계

연구진은 두 가지 한계를 명시했다. 첫째, 이 방법은 환경에서 오는 보상 신호를 필요로 하기 때문에, 열린 형식의 생성처럼 보상을 얻기 어려운 과제에서는 검증되지 않았다. 둘째, 자원과 연산의 제약 때문에 32B보다 큰 모델에서도 같은 현상이 나타나는지는 확인하지 못했다4.

사회적 영향에 관한 서술도 짧게 붙어 있다. 보상 정보가 어디에 있는지 알면 투명성과 효율이 함께 나아지지만, 같은 지식으로 보상 신호를 선택적으로 억제하거나 증폭해서 안전 장치를 우회하는 조작도 가능해진다. 연구진은 뉴런 단위 제어 기법을 실제로 배치하기 전에 적대적 조건에서의 견고성을 먼저 조사하고 안전 장치를 마련할 것을 권했다.

가장 흥미로운 지점

이 논문이 내놓은 숫자 가운데 0.7%가 나를 가장 놀라게 했다. 보상으로 학습한 프로브가 지목한 상위 1% 뉴런과, 다음 토큰 예측으로 학습한 프로브가 지목한 상위 1% 뉴런은 0.7%만 겹쳤다. 무작위로 골랐을 때의 기대 겹침이 0.5%이니 두 집합은 거의 겹치지 않는 별개의 위치를 차지한다. 같은 모델, 같은 층, 같은 프로브 구조인데도 학습 목표를 무엇으로 두느냐에 따라 프로브는 전혀 다른 소수의 뉴런을 지목한다.

5번 층에서 나온 1.2%라는 정확도까지 함께 보면 대비가 더 분명해진다. 그 층에서 가치 뉴런 상위 1%를 끄자 MATH500 정확도가 75.2%에서 1.2%로 떨어졌다. 모델이 거의 수학을 못 하게 되었다는 말이다. 같은 층에서 같은 수의 뉴런을 무작위로 껐을 때는 0.8%p 떨어지는 데 그쳤다. 수십억 개의 매개변수 가운데 몇백 개를 껐을 뿐인데 추론 능력이 통째로 사라졌다.

신경과학에서 이름을 빌려 온 대목은 조심해서 읽어야 한다. 연구진 스스로도 비유라고 적어 두었다. 활성 곡선이 봉우리와 골을 그린다는 관찰과, 생물의 도파민 뉴런이 하는 일이 같다는 주장 사이에는 아직 거리가 있다. 그럼에도 연구진은 프로브를 학습시키고 가지치기를 하고 활성을 0으로 만들어 보는 세 단계를 차례로 밟았다. 그렇게 필요성과 특이성과 기능적 일관성을 구분해 본 점은 설득력이 있었다.

출처

발행: arXiv, cs.CL, arXiv:2602.00986 저자: Guowei Xu (칭화대학교), Mert Yuksekgonul (스탠퍼드대학교), James Zou (스탠퍼드대학교) 제출: 2026년 2월 1일 (v1), 2026년 5월 11일 개정 (v2) 원문: https://arxiv.org/abs/2602.00986

본문의 그림은 원문의 Figure 3, 9, 10을 인용했다. 이 논문은 arXiv 비독점 배포 라이선스(nonexclusive-distrib 1.0)로 공개되어 있으며 저작권은 저자들에게 있다.


  1. 중첩 가설은 신경망이 뉴런 수보다 많은 특징을 표현하기 위해 여러 특징을 같은 뉴런들에 겹쳐 담는다는 설명이다. 이 가설에 따르면 자주 쓰이고 중요한 특징일수록 겹침이 적은 전용 표현을 배정받는다. ↩︎

  2. AUC는 예측값을 기준으로 정답 사례와 오답 사례를 얼마나 잘 구분하는지 재는 지표다. 0.5는 무작위와 같은 수준이고 1에 가까울수록 구분이 잘 된다. ↩︎

  3. 스피어만 상관은 두 값의 크기 대신 순위만 비교해 계산하는 상관 계수다. 관계가 직선이 아니어도 단조롭게 증가하거나 감소하면 높은 값이 나온다. ↩︎

  4. 실험에 쓴 장비도 논문에 적혀 있다. 응답 생성에는 NVIDIA RTX PRO 6000 Blackwell 서버 에디션 GPU 두 장을 썼고, 프로브 학습과 추론에는 같은 GPU 한 장을 썼다. ↩︎