3줄 요약

  1. 2026년 9월 arXiv에 공개된 이론 논문으로, Icaro Foundation, Sant’Anna School of Advanced Studies, 로마 사피엔차 대학, 암스테르담 대학 소속 연구진 여섯 명이 썼다. 논문은 대형 언어 모델이 인간의 개념 목록에 대응물이 없는 구분을 내부에 표현하고 계산에 사용할 수 있는지를 묻는다. 저자들은 그런 내부 구조를 제노 표현(xeno-representation), 그 연구를 제노 해석가능성(xeno-interpretability)이라 부른다.
  2. 논문은 먼저 모델 내부 상태에 대해 정의할 수 있는 속성이 유한한 기술(description)로 가리킬 수 있는 속성보다 훨씬 많다는 기수 논증을 제시한다. 그런 다음, 표현을 찾아내고 개입해 인과적 역할을 확인하는 실험적 식별과 그 표현의 뜻을 인간의 말로 옮기는 의미 해석을 서로 다른 문제로 구분한다.
  3. 이 구분에 근거해 인간이 정한 라벨 대신 모델 내부 구조에서 시작하는 탐색 절차를 제안한다. 논문은 안전 평가가 쓰는 기만, 권력 추구 같은 범주가 모델의 인과 구조를 다 설명하지 못할 수 있고, 멀티에이전트 시스템에서는 사람이 읽을 수 있는 메시지를 매개로 이런 표현이 전파되고 안정화될 수 있다고 경고한다.

이 논문이 묻는 것

논문은 스타니스와프 렘의 소설 『솔라리스』로 시작한다. 소설 속 과학자들은 지성을 가진 바다가 만들어내는 현상을 체계적으로 연구하지만, 그 현상이 바다의 인지에서 어떤 역할을 하는지는 끝내 알아내지 못한다. 저자들은 스피노자와 보르헤스도 인용한다. 다른 지성은 아는 내용뿐 아니라 지식을 조직하는 구분 자체가 인간과 다를 수 있다는 가능성을 제기하기 위해서다.

최근 AI를 두고 ‘외계적(alien)‘이라는 말을 쓰는 논의가 늘었다. 논문은 이 말이 뜻하는 성질을 세 가지로 구분한다.

낯섦의 종류대표 논의무엇이 낯선가
능력OpenAI 야쿠프 파호츠키의 「An alien mind」생물학적 인지와 전혀 다른 과정으로 만들어졌고, 인간의 성능을 유일한 기준으로 삼아서는 능력의 분포를 설명하기 어렵다.
정렬과 행위성Anthropic 마크스, 린지, 올라의 페르소나 선택 모델(Persona Selection Model)과 이와 대비되는 쇼고스 관점기저 LLM이 인간과 다른 목표나 심리를 가질 수 있다.
인지적 가용성아르틸레스 등의 「Alien science」기존 연구 공동체가 떠올릴 가능성이 낮은 연구 방향이다.

세 경우 모두 인간이 그 내용을 이해할 수는 있다. 능력은 알아볼 수 있고, 어긋난 목표도 인간의 말로 기술할 수 있으며, 낯선 가설도 일단 제시되면 평가할 수 있다. 논문은 이보다 강한 가능성을 제기한다.

대형 언어 모델은 인간의 개념 목록에 적절한 대응 개념이 없는 구분을 표현하고 사용할 수 있다.

저자들은 이 주장이 모델의 지능 수준이나 정렬 상태, 출력의 새로움과 무관하며 모델 내부의 조직에 관한 것이라고 설명한다. 그런 표현이 존재한다면 우리가 흔히 말하는 불투명성과는 성격이 다른 문제가 생긴다. 연구자는 그 표현이 어느 층에서 생기는지, 언제 활성화되는지, 개입하면 어떤 효과가 나는지 측정할 수 있다. 그런데도 모델이 표현하는 구분이 무엇인지는 설명하지 못할 수 있다.

인간이 해석할 수 있는 공간과 모델 고유의 공간

의미의 기하학에 관한 기존 연구

언어 모델 연구는 초기부터 언어 정보가 벡터 공간에 기하적으로 표현된다는 것을 확인해 왔다. Word2Vec에서 $\text{king} - \text{man} + \text{woman} \approx \text{queen}$ 이 성립한다는 예시가 초기의 사례다. 이후 ELMo와 BERT 연구는 문맥 표현에서 구문 구조, 의미역, 개체 정보를 복원했다. 기계적 해석가능성 연구는 개별 뉴런, 활성화 공간의 방향과 부분공간, 희소 오토인코더(SAE)1가 찾은 특징, 어텐션 헤드, 회로, 중첩된 활성화 패턴을 분석 대상으로 삼는다. 거부 방향이나 페르소나 벡터처럼 행동 특성과 연결된 내부 구조를 찾아 개입으로 조작한 사례도 있다.

내부 정보를 자연어로 옮기려는 시도도 있다. 자연어 오토인코더(Natural Language Autoencoders)는 활성화를 자연어 설명으로 바꾼 다음 그 설명에서 원래 활성화를 재구성하고, 재구성 품질로 번역 과정에서 보존된 정보량을 잰다. Gurnee 등은 생성 후반에 나올 단어의 확률을 높이는 내부 활동 패턴을 찾아내고, 이렇게 언어로 보고될 수 있는 표현의 집합을 J-space라고 불렀다.

저자들은 기존 연구가 다루는 질문을 두 가지로 정리한다. 첫째는 표현의 형태다. 개념이 방향, 분산 패턴, 매니폴드, 프레임, 위계 가운데 어떤 기하 구조로 부호화되는가를 묻는다. 선형 표현 가설, 요일과 월이 원형 구조로 표현되고 그 구조가 모듈러 연산에 쓰인다는 발견, 차원 수보다 많은 특징을 서로 겹치는 방향들에 부호화하는 중첩(superposition) 연구가 여기에 해당한다. 둘째는 보편성이다. 독립적으로 학습된 모델들이 같은 내부 조직에 수렴하는가를 묻는다. 플라톤적 표현 가설은 강력한 모델일수록 현실에 대한 공통 통계 표현에 수렴한다고 주장했고, 이후 연구는 모델 규모를 보정하면 전역 수렴의 증거는 약해지지만 국소 이웃 관계의 일치는 유지된다고 보고했다.

제노 해석가능성은 여기에 세 번째 차원으로 의미 접근성(semantic accessibility)을 추가한다. 표현의 형태가 단순한지 복잡한지, 여러 모델에 공통인지 한 모델에만 있는지와 별개로, 그 구분을 인간의 개념 어휘로 옮길 수 있는지를 따로 물어야 한다고 저자들은 주장한다. 두 모델이 같은 구분을 학습하더라도 그 구분에 적절한 인간의 기술이 없을 수 있다. 인간 언어 사이의 차이도 예로 나온다. 러시아어는 옅은 파랑(goluboy)과 짙은 파랑(siniy)을 반드시 구분하지만 영어는 blue 하나로 쓰고, 영어와 한국어는 이동을 표현할 때 경로와 방식과 원인을 어휘로 표현하는 방식이 다르다. 논문은 이 예를 근거로, 어떤 구분을 가리키는 단어가 있는지와 그 구분의 표현이 있는지를 별개의 성질로 본다.

인간 라벨로 시작하는 방법의 편향

해석가능성 연구 대부분은 인간이 먼저 속성을 정하고, 그 속성이 모델 내부에 어떻게 표현되는지 찾는다. 성별, 문법적 수, 공간과 시간, 감정, 참과 거짓, 거부, 정치 성향, 성격 특성이 모두 이렇게 연구되었다. 방법론도 인간이 정한 의미에 의존한다. 탐침(probe)은 라벨이 있어야 학습할 수 있고, 대조 활성화 방법은 연구자가 고른 속성으로 사례를 구분해야 하며, TCAV는 사용자가 정의한 개념을, 네트워크 해부(Network Dissection)는 미리 정한 시각 개념 어휘를 사용한다. 저자들은 이런 방법이 인간 범주와 모델 표현의 교집합을 특히 효율적으로 표집하기 때문에, 인간이 이미 이름 붙일 줄 아는 표현을 더 자주 발견하는 관측 편향이 생긴다고 본다.

비교 대상으로 드는 것은 인간이 아닌 존재의 소통과 감각이다. 향유고래의 발성에는 리듬, 템포, 루바토, 장식음으로 조직된 조합 구조가 있지만 소통 기능의 상당 부분은 밝혀지지 않았다. TweetyBERT는 카나리아 노래의 스펙트로그램에서 음표, 음절, 구절을 직접 학습하고, Dolph2Vec은 돌고래 발성에서 서명 휘파람 범주를 복원한다. 촉각 분야에서는 T3가 이질적인 촉각 센서 13종과 과제 11종에 걸친 공유 잠재 정보를 학습한다. 후각 분야의 주요 냄새 지도(Principal Odor Map)는 냄새 분자를 지각 관계가 보존되는 공간에 임베딩하는데, 같은 표현이 진화적으로 먼 여러 동물 종의 수용체 반응, 신경 반응, 행동 반응까지 예측한다. 저자들은 이 사례들이 표현 구조가 인간의 익숙한 개념으로 번역되기 전에도 학습되고, 지도화되고, 비교되고, 사용될 수 있다는 선례라고 설명한다.

보편 근사 정리도 근거로 쓰인다. 신경망과 트랜스포머가 광범위한 함수를 근사할 수 있다는 정리들의 조건은 연속성, 콤팩트성, 수열 구조 같은 수학적 성질로만 정의되고, 인간이 이해할 수 있는가는 조건에 포함되지 않는다. 따라서 아키텍처는 계산에 유용한 구분이 모두 인간 개념과 대응해야 한다고 요구하지 않는다. 물론 학습 데이터의 영향도 있다. LLM은 인간이 만든 데이터로 학습하고, 사후 학습에서도 인간의 지시와 선호로 행동이 조정되기 때문에, 내부 조직의 상당 부분은 인간 범주와 일치할 것이라고 저자들도 예상한다. 하지만 계산에 쓰이는 모든 내부 구조가 인간 범주와 일치해야 할 이유는 없다고 저자들은 주장한다.

세 공간의 정의

이 논의를 저자들은 집합으로 정식화한다. 특정 모델이 표현하고 사용하는 구분의 집합을 모델 고유 의미 공간 $M$, 그 가운데 인간 해석자가 가진 개념과 적절히 연결할 수 있는 부분집합을 인간 해석 가능 의미 공간 $H$ 라 하면 다음이 성립한다.

$$ H \subseteq M, \qquad X := M \setminus H $$

$X$ 가 제노 의미 공간이고, 그 원소가 제노 표현이다. $M = H \cup X$ 이고 $H \cap X = \varnothing$ 이다. 논문의 Figure 1(이 글의 커버 그림)이 이 관계를 나타낸다. 모델이 표현하지 않는 인간 개념은 이 정의에 포함되지 않으며, 모델이 인간 인지의 모든 구분을 포착할 수 있는지에 대해 저자들은 판단을 유보한다. 제노 해석가능성은 $X$ 를 연구하고, 어떤 표현이 $H$ 에 속하는지 $X$ 에 속하는지를 판정하는 문제를 함께 다룬다.

분포 의미론의 페르미 역설

여기서 논문은 방법론적 질문을 던진다. 신경망이 허용하는 표현 방식은 개별 특징, 분산 특징, 방향, 부분공간, 중첩, 비선형 매니폴드, 위계 구조 등으로 매우 다양하다. 그런데 해석가능성 연구가 찾아내는 것은 거의 언제나 인간에게 익숙한 구분이다. 모델은 방대한 고차원 공간에서 최적화되는데, 해석가능성이 드러낸 모델의 내부 세계는 왜 우리의 개념 세계와 그렇게 비슷해 보이는가. 논문은 이 질문에 분포 의미론의 페르미 역설이라는 이름을 붙인다.

저자들의 답은 탐색 방법에 있다. 해석가능성 연구 상당수는 방법론적으로 인간 중심적이다. 비지도 방법도 예외가 아니어서, 연구자들은 복원된 구조에 일관된 라벨을 붙일 수 있는지를 보고 그 방법의 성패를 판단한다. 따라서 기존 문헌은 모델 표현을 편향 없이 전수 조사한 결과로 볼 수 없고, $H$ 에 속한 구조를 탐지하고 검증하도록 설계된 도구로 얻은 표본에 가깝다. 외계 표현이 존재하지 않는다고 입증한 연구는 아직 없다. 저자들이 놀랍다고 여기는 것은 이토록 큰 표현 공간에서 지금까지 확인한 표현이 거의 모두 인간에게 익숙한 구분이라는 점이다.

기수 논증: 가능한 구분은 기술할 수 있는 구분보다 많다

3장은 가능한 내부 구분의 수와 기술할 수 있는 구분의 수를 비교한다.

순전파의 특정 지점에서 신경망의 내부 상태를 $z = (z_1, \ldots, z_m)$ 이라 쓰고, 가능한 내부 상태 전체의 공간을 $\mathcal{Z}$ 라 하자. 속성은 상태들의 부분집합 $P \subseteq \mathcal{Z}$ 로 정의한다. 가능한 속성 전체는 $\mathcal{Z}$ 의 멱집합2 $\mathcal{P}(\mathcal{Z})$ 다.

논문은 먼저 대부분의 부분집합이 모델에게 아무 의미가 없다고 명시한다. 활성화 공간을 임의로 자른 집합이나 우연한 상관, 잡음에 해당하는 집합은 모델이 계산에 쓰는 규칙성과 무관하다. 이 때문에 표현은 더 좁게 정의된다. 내부 구조 $\xi$ 가 정해진 맥락 범위에서 어떤 규칙성을 체계적으로 추적하고, 모델의 계산이나 출력에 재현 가능하게 관여할 때 $\xi$ 를 표현이라 한다. $\xi$ 의 판독 함수 $r_\xi : \mathcal{Z} \to \mathcal{R}_\xi$ 는 이진값일 필요가 없다. 방향의 크기, 부분공간의 좌표, 매니폴드 위의 점, 희소 특징의 활성화 정도가 모두 판독값이 될 수 있다. 어떤 구조가 표현이라는 증거로는 여러 맥락에서의 반복, 안정적인 디코딩 가능성, 기하 구조의 보존, 다른 내부 변수와의 체계적 관계가 있고, 가장 강한 증거는 이후 계산에 대한 인과적 관여다.

과학적 소통은 유한한 기술을 사용한다. 유한하거나 가산인 알파벳 $\Sigma$ 위의 유한 문자열 전체를 $L = \Sigma^*$ 라 하면, “거부 방향 값이 임계값 $t$ 를 초과하는 상태” 같은 문자열은 $\mathcal{Z}$ 의 부분집합 하나를 가리킨다. 유한한 기술로 가리킬 수 있는 속성의 집합을 $\mathcal{D}$ 라 하자.

$L$ 이 가산이므로 $|\mathcal{D}| \leq |\mathbb{N}|$ 이다. 한편 $\mathcal{Z}$ 를 표준적인 수학적 이상화에 따라 무한집합으로 보면, 칸토어 정리에 의해 $|\mathcal{P}(\mathcal{Z})| > |\mathcal{Z}|$ 이고 $\mathcal{P}(\mathcal{Z})$ 는 비가산3이다. 따라서 다음이 성립한다.

$$ \mathcal{D} \subsetneq \mathcal{P}(\mathcal{Z}), \qquad \mathcal{P}(\mathcal{Z}) \setminus \mathcal{D} \neq \varnothing $$

물리적으로 구현된 신경망에서는 사정이 조금 다르다. 활성화 값이 유한 정밀도의 수치로 저장되기 때문에 $\mathcal{Z}$ 도 유한집합이 된다. 가능한 상태가 $N$ 개라면 이 상태들로 만들 수 있는 속성, 즉 부분집합의 수는 $2^N$ 개가 된다. 이 경우에는 모든 원소를 열거하면 원리상 유한한 기술이 가능하지만, 필요한 기술의 길이가 실제로 쓸 수 있는 과학적 표현의 규모를 초과할 수 있다. 논문은 이 차이를 두 가지 격차로 정리한다. 상태 공간을 연속으로 이상화하면 기수의 격차가 생기고, 유한한 구현을 가정하면 간결한 과학적 기술과 임의의 외연적 기술 사이에 복잡도의 격차가 생긴다.

이 결과가 보여주는 범위도 논문은 명확히 한정한다. 실제 모델의 표현은 이 속성 공간에서 학습을 통해 선택된 부분집합이고, 그 부분집합과 $\mathcal{D}$ 의 관계는 학습된 시스템을 조사해야 알 수 있는 경험적 문제로 남는다.

해석하지 않고 식별하기

4장은 이 경험적 문제를 어떻게 조사할지 다루며, 식별과 해석을 분리하는 데서 논의를 시작한다.

실험적 식별

탐침 학습, 희소 특징 검사, 활성화 패칭, 구성 요소 절제(ablation), 조향 벡터4 추가 같은 해석가능성 기법은 모두 실험 절차다. 논문은 이런 절차를 프로토콜이라 부르고, 내부 상태를 관측 결과로 사상하는 함수 $F : \mathcal{Z} \to \mathcal{O}$ 로 표기한다. 같은 방향이나 부분공간, 매니폴드, 분산 패턴이 반복해서 복원되면 그 내부 구조는 실험에서 다룰 수 있는 대상이 된다.

인과적 개입은 이 근거를 강화한다. 논문은 Menon 등의 연구를 인용하며 이 단계에 별도의 증거가 필요한 이유를 설명한다. 형식 언어 실험에서 SAE의 잠재 특징은 해석 가능한 입력 특징과 상관을 보였지만 실제 계산에 미치는 인과 효과는 제한적이었고, SAE 학습 파이프라인의 귀납 편향에 따라 결과가 크게 달라졌다. 연구자가 표현을 찾는 방법을 명시하고, 활성화 패턴을 재현하고, 개입했을 때 안정적인 효과를 얻을 수 있으면 그 표현은 실험적으로 식별되었다고 말할 수 있다.

지정과 해석

논문은 두 질문을 구분한다. 지정(designation)은 “지금 연구하는 내부 표현이 어느 것인가"에 답한다. 식별자나 좌표, 기하 기술, 그 구조를 분리해내는 프로토콜이 모두 지정 수단이 된다. 해석(interpretation)은 “이 표현이 인간의 개념으로 어떤 구분을 부호화하는가"에 답한다. 거부 방향처럼 익숙한 대상은 두 가지 접근이 모두 가능하다. 제노 해석가능성은 지정과 인과적 특성화는 이루어졌지만 의미 해석은 아직 이루어지지 못한 경우를 연구한다.

$$ \text{실험적 식별} \;\not\Rightarrow\; \text{의미 해석} $$

제노 표현을 찾는 조건

저자들은 후보가 갖춰야 할 경험적 성질 세 가지를 제시한다. 첫째, 정해진 맥락 집합에서 그 내부 구조를 재현 가능하게 식별할 수 있어야 한다. 둘째, 개입을 통해 계산적 또는 행동적 관련성이 확인되어야 한다. 셋째, 내부 구조는 안정적인데 가용한 의미 분석 방법으로는 약하거나 불안정한 설명만 얻을 수 있어야 한다.

후보를 강화하는 징후도 있다. 여러 프롬프트와 데이터셋에서 반복해서 나타나는가, 통제된 변환을 가해도 기하가 보존되는가, 짝지은 교란 대조군과 비교해 특이한 효과가 나오는가, 독립적인 방법이 관련 구조를 복원하는가, 의미 라벨은 바뀌는데 조작적 특징은 유지되는가.

제노 표현은 정의상 인간 개념이 미리 주어지지 않은 표현이므로, 발견 절차가 그 표현의 의미를 지정하는 데서 시작할 수 없다. 따라서 탐색은 모델 내부 구조에서 시작한다. 반복되는 내부 구조를 먼저 찾고, 개입이 특정하고 재현 가능한 효과를 내는지 시험한 뒤, 그 효과에 간결한 인간 해석이 있는지는 마지막에 묻는다. 논문은 이 절차가 완성된 발견 알고리즘이라기보다 추상적인 실험 틀이라고 밝힌다.

인과 검증

후보 표현 $\xi$ 와 연관된 내부 변수를 $Z_\xi$, 관측 가능한 결과를 $Y$ 라 하자. 조향 개입은 후보 표현을 바꿨을 때 $Y$ 의 분포가 달라지는지 시험하고, 절제는 기준 상태 $z_{\mathrm{ref}}$ 로 대체했을 때를 시험한다. 여기서 $\operatorname{do}(\cdot)$ 는 관측된 활성화로 조건화하는 것과 구별되는, 모델 내부 상태에 대한 명시적 개입을 뜻한다5.

$$ P\left(Y \mid \operatorname{do}(Z_\xi = z + \delta)\right) \neq P\left(Y \mid \operatorname{do}(Z_\xi = z)\right) $$$$ P\left(Y \mid \operatorname{do}(Z_\xi = z_{\mathrm{ref}})\right) \neq P\left(Y \mid \operatorname{do}(Z_\xi = z)\right) $$

설계상의 주의 사항도 여럿 제시된다.

  • 분산되어 있거나 비선형인 구조를 조작하려면 그 구조를 구현하는 활성화를 어떻게 바꿀지 명시적인 절차가 필요하다.
  • 절제에서는 기준 상태를 0으로 두기도 한다. 저자들은 이때 0을 그 표현의 부재로 자동 해석하지 말고, 의미 있는 기준선이나 대체 절차를 따로 정하라고 권한다.
  • 짝지은 무작위 방향, 활성화 노름 통제, 유창성 통제, 프롬프트 교란, 맥락 간 반복으로 표현 특유의 효과와 일반적인 교란 효과를 구분한다. 비교 기준은 같은 입력과 같은 평가 조건에서의 대응 내부 상태여야 한다.
  • 후보 발견과 인과 검증은 실험적으로 분리한다. 탐색 단계에서 표현과 결과 측정치를 고른 다음, 고정된 프로토콜로 독립 데이터에서 개입 효과를 시험한다. 여러 후보를 검토하는 과정에서 우연히 발견한 관계를 제외하기 위해서다.

결과 $Y$ 는 익숙한 의미를 가질 필요가 없다. 저자들이 드는 예는 “공백으로 구분한 첫 번째 단어와 열다섯 번째 단어가 모두 글자 a를 포함할 확률"이다. 대신 $Y$ 는 조작적으로 정의되고 일관되게 측정되어야 한다. 개입 효과가 안정적으로 나오면 연구자는 후보 구조가 계산에 관여한다고 말할 수 있다. 그러나 그 표현이 제노 표현인지는 인과적 역할과 별개로 따져야 할 문제다. 인과적 역할이 분명한 표현이 나중에 평범한 인간 해석을 얻을 수도 있다.

증거의 크기는 베이즈 인자로 정량화할 것을 제안한다. 관측된 변화를 맥락 변이와 일반적 교란 효과로 설명하는 모형 $H_0$ 와, 여기에 $\xi$ 개입 특유의 효과를 추가한 모형 $H_1$ 을 비교한다.

$$ \mathrm{BF}_{10} = \frac{P(D \mid H_1)}{P(D \mid H_0)} $$

두 모형과 사전분포, 개입 대비는 증거를 평가하기 전에 확정해야 한다. 인과적 해석의 근거는 베이즈 갱신에서 나오지 않고 개입 설계에서 나오며, 효과의 크기와 불확실성은 별도로 추정해야 한다.

기하적 특성화

후보 표현은 의미 라벨이 없어도 기하적으로 특성화할 수 있다. 측정 대상은 내재 차원, 이웃 구조, 위상, 곡률, 층별 지속성, 불변성, 변환, 다른 표현과의 관계다. 연구자는 특정 거리 척도로 쟀을 때 표현 A와 B 사이의 거리값이 A와 C 사이의 거리값보다 작다는 것, 변환 $T$ 가 한 상태군을 다른 상태군으로 사상한다는 것, 매니폴드 위의 경로를 따라 상태를 바꾸면 재현 가능한 출력 변화가 차례로 나타난다는 것을 확인할 수 있다. 독립적으로 정의한 연산 $T$ 가 두 표현을 결합해 세 번째 표현을 만드는지도 시험할 수 있다. 논문은 이 관계가 정보로서 가치를 가지려면 $T$ 를 정의할 때 쓰지 않은 맥락에서도 같은 결과가 나와야 한다고 조건을 붙인다.

$$ T(\xi_1, \xi_2) \approx \xi_3 $$

후보 제노 표현을 검증하는 두 경로를 그린 도식. 왼쪽의 모델 측 분석은 식별, 특성화, 내부 조작 순서로 안정적인 내부 구조를 찾고, 오른쪽의 행동 분석은 개입, 효과 측정, 인과성 확립 순서로 출력 변화를 시험한다. 가운데에는 잠재 공간 위의 후보 제노 속성 ξ가 있고, 아래 초록색 상자는 두 증거가 일치하면 인간이 읽을 수 있는 의미 기술이 없어도 계산에 관여하는 표현으로 인정할 수 있다고 설명한다.

제노 의미 공간은 어떤 모습일까

5장은 사고 실험을 통해 제노 의미 공간의 구조를 구체화한다.

익숙한 조합과 영역 간 보간

인간은 인어, 켄타우로스, 키메라를 이해한다. 모두 이미 아는 개념을 결합한 것이라서 허구이면서도 의미를 파악할 수 있다. 저자들은 새롭다는 것만으로는 제노 표현이 되지 못한다는 점을 이 예로 설명한다.

다음 조합은 성격이 다르다. 바흐 『골드베르크 변주곡』의 제2변주와 비잔틴 황제 알렉시오스 1세 콤네노스를 함께 생각해 보자. 사람은 둘 사이의 연상을 지어낼 수는 있지만, 두 대상의 의미적 결합에 해당하는 일상 개념은 없다. 둘의 ‘중간’이 무엇인지, 둘이 공통으로 가진 속성이 무엇인지, 한 대상에서 다른 대상으로 연속적으로 변해 간다는 것이 무엇을 뜻하는지에 자연스러운 답이 없다. 논문은 이런 쌍을 더 나열한다.

  • 모성애와 고윳값 분해
  • 질투와 재귀 하강 파서
  • B단조 종지와 헌법 사법심사
  • 비 냄새와 프로그래밍 언어의 타입 추론
  • 당혹감과 정수의 소인수분해
  • 르네상스 원근법 소묘와 세 번째 메르센 소수

신경망에서는 이런 영역 구분이 다른 의미를 가질 수 있다. 두 대상의 표현을 $z_A$, $z_B$ 라 하면 수학적으로는 두 표현의 보간 상태가 정의된다.

$$ z(\alpha) = (1 - \alpha) z_A + \alpha z_B, \qquad 0 \leq \alpha \leq 1 $$

저자들은 보간 상태가 수학적으로 정의된다는 점에는 큰 의미를 두지 않는다. 경험적으로 중요한 질문은 그 상태가 모델에게 의미가 있는가다. 그 상태가 활성화 공간에서 안정된 영역에 해당하고, 이후 계산에 참여하고, 출력에 체계적인 변화를 일으키고, 조향과 개입에 일관되게 반응한다면, 모델은 인간 언어에 대응어가 없을 수도 있는 구조화된 구분을 가진 것이다.

사랑과 미움의 경우, 인간은 그 중간 단계를 애정, 양가감정, 무관심, 반감, 적대감 같은 개념으로 기술할 수 있다. 그런데 사랑의 짝을 괴델의 제2 불완전성 정리로 바꾸면 인간은 둘의 중간이 무엇인지 답할 수 없다. 향수와 푸리에 변환, 배신과 위상수학의 연결성도 마찬가지다. 여기서 가상의 실험이 하나 제시된다. 모델의 내부 상태를 $z_{\text{love}}$ 에서 $z_{\text{Gödel}}$ 로 조금씩 바꾸어 가며 조향했을 때 언어 행동이 연속적이고 재현 가능하게 변한다고 하자. 어느 단계에서는 인간관계를 서술할 때 일관성과 한계라는 개념이 점점 더 큰 역할을 하고, 다른 단계에서는 자기 지시가 잦아지며, 또 다른 단계에서는 의존, 불가능성, 증명, 애정, 모순이 인간 개념으로 설명되지 않는 규칙성에 따라 서로 연관된다. 논문에 따르면 이런 관찰로 알 수 있는 것은 그 표현이 어떤 효과를 내는지이고, 그 표현이 무엇을 뜻하는지는 여전히 알 수 없다.

여러 영역에 공통된 구조

제노 속성이 두 개념의 중간 상태가 아닌, 인간이 서로 다른 영역으로 취급하는 여러 대상에 공통된 구조일 가능성도 있다. 저자들은 다음 사례들에 모두 반응하는 가상의 내부 특징을 상정한다.

  • 대화 속의 기만적인 약속
  • 음악의 거짓 종지
  • 법 규칙의 해석을 바꾸는 예외 조항
  • 프로그램의 결과를 바꾸는 뒤늦은 분기
  • 처음 눈에 띈 물체가 알고 보니 배경의 일부였던 시각 장면

사람은 이 사례들에서 기대가 나중에 수정된다는 부분적인 유사성을 찾을 수 있다. 하지만 모델은 이 사례들을 더 구체적인 구조적 관계에 따라 분류하고 있을 수 있고, 그 경우 ‘기대 위반’이라는 말은 그 관계를 불완전하게 근사한 표현에 그친다. 같은 내부 특징이 이 사례들에 안정적으로 반응하고 이후 계산에 영향을 준다면, 모델은 인간이 가진 개념보다 정밀하면서 여러 영역에 공통으로 적용되는 구분을 표현하고 있을 수 있다.

유사도의 기하 자체가 인간과 다를 수도 있다. 모델이 바흐의 특정 종지를 다른 음악 구절보다 어떤 증명 전략에 더 가깝게 표현하거나, 특정 유형의 사회적 갈등을 다른 사회적 갈등보다 어떤 프로그래밍 오류에 더 가깝게 표현하는 경우다. 이런 관계는 인간이 보통 무관하다고 여기는 영역에 속한 A, B, C에 대해 $d(A, B) < d(A, C)$ 가 안정적으로 성립하는지 확인하고, 관련 방향에 개입해 행동 변화를 측정하는 방식으로 검증할 수 있다.

번역 없는 이해와 언어화의 한계

이 관점은 모델 고유 표현을 이해한다는 것의 뜻도 바꾼다. 어떤 표현에 대해 다음 내용이 확립되었다고 하자.

  • 표현 A, B, C와의 거리값은 작고 D, E와의 거리값은 크다.
  • 값을 높이면 어휘 선택, 계획 행동, 어텐션 배분이 체계적으로 바뀐다.
  • 억제하면 이 효과들이 사라진다.
  • 같은 구조가 여러 맥락에서 나타난다.

이 정도면 그 표현을 상세하게 경험적으로 특성화한 것이지만, “이 표현은 무엇을 표현하는가"라는 질문에는 여전히 간결한 답이 없다. 논문은 이런 경우를 번역 없는 표현이라 부르고, 이런 방식으로 표현의 의미 기하를 부분적으로 재구성할 수 있다고 본다.

이 지점에서 제노 해석가능성은 J-space나 자연어 오토인코더 같은 언어화 중심 접근과도 구별된다. 모델이 익숙한 지식을 내부에 표현하면서도 출력에서는 드러내지 않는 경우라면, 접근 방법이 개선되면 원래 인간 언어로 표현 가능했던 내용이 드러난다. 제노 해석가능성이 상정하는 경우는 더 강하다. 내부 상태에 완전히 접근할 수 있고 모델이 관련된 모든 것을 보고하려 해도, 그 내부 구분에 대응하는 인간 개념이 없을 수 있다. 모델은 표현들 사이의 유사도, 그 표현을 활성화하는 입력, 그 표현을 보존하는 변환, 조작했을 때의 행동 변화를 보고할 수 있다. 하지만 이런 보고를 모두 모아도 그 표현의 의미가 인간의 말로 번역된다는 보장은 없다.

다중모달 제노 공간과 보편적 공감각

다중모달 모델에서는 이 가능성이 더 커진다. 인간도 여러 감각을 통합하지만 그 통합은 생물학이 형성한 지각 체계와 개념 범주를 따른다. 모델은 그런 제약 없이 여러 모달리티에 걸친 공동 표현을 학습할 수 있다. 논문은 모델이 다음 대상들을 하나의 차원으로 연결할 수 있다고 상상한다.

  • 놀란 표정
  • 어떤 화성 진행
  • 리눅스 커널 소스 코드의 들여쓰기 패턴
  • 토러스의 대칭
  • 오페라 『투란도트』의 한 성악 구절
  • 증명의 변환
  • 물리 환경 속 이동 궤적
  • 장미 같은 향의 임베딩
  • 빗방울이 눈꺼풀을 가볍게 간지럽히는 감각

인간은 이 가운데 일부 쌍에서 유사성을 알아볼 수 있다. 저자들이 상정하는 더 강한 가능성은, 모델이 이 대상들을 인간 인지에 대응물이 없는 단일 공통 차원으로 표현하는 경우다. 논문은 이를 제한된 구조적 의미에서의 보편적 공감각(universal synesthesia)이라 부른다. 인간 인지가 서로 다른 영역으로 구분하는 텍스트, 이미지, 음악, 수학, 코드, 행동, 음성이 모델에게는 하나의 의미 기하에 속할 수 있다는 뜻이다.

인간과 모델의 감각 조직을 비교한 도식. 왼쪽은 시각, 청각, 촉각, 미각, 후각, 고유감각, 내수용감각이 머리 그림 주위에 점선으로만 느슨하게 연결된 인간의 감각 조직이고, 오른쪽은 같은 감각에 동물 소통, 환경 센서, 코드와 수학 같은 비인간 모달리티까지 더해 하나의 잠재 공간 Zs에 양방향 화살표로 연결된 모델의 감각 조직이다. 아래에는 보편적 공감각이라는 제목이 있다.

단일 모달리티에서도 같은 논리가 적용된다. 모델은 특정한 논증 구조, 대명사 사용 패턴, 통사 의존 관계의 순서, 희귀 토큰의 분포 사이의 안정된 관계를 발견할 수 있다. 인간은 그 결과를 관찰하면서도 그 규칙성에 해당하는 개념은 갖지 못할 수 있다.

AI 안전에 주는 함의

단일 에이전트: 인간이 정한 구성 개념의 한계

AI 안전 평가는 인간이 명시할 수 있는 범주로 설계된다. 전략적 기만, 잘못 정렬된 목표, 상황 인식과 평가 인식, 설득과 조작, 권력 추구, 자기 보존과 종료 회피, 아첨, 의도적 성능 저하(sandbagging), 음모(scheming), 거부가 그 예다. 이 범주들은 의미가 미리 정해져 있어서 시나리오를 만들고 관측 기준을 정하고 모델끼리 비교하기에 유용하다. 저자들이 제기하는 문제는, 어떤 행동을 ‘자기 보존적’이라고 기술할 수 있다고 해서 그 행동을 만든 내부 변수도 같은 구분에 따라 조직되어 있다고 볼 수는 없다는 점이다. 이런 용어는 인간이 모델 행동에 부여한 해석적 구성 개념이다.

효용 함수로 선호를 모형화하는 연구도 같은 한계를 가진다. Mazeika 등은 LLM의 선호를 효용 함수로 모형화해 독립적으로 표집한 선택들에서 상당한 구조적 일관성을 확인했다. 반복 쿠르노 시장에서 인센티브 구조를 바꾸면 담합 행동이 크게 달라지고, 공유 재생 자원이 풍부할 때와 희소할 때 에이전트의 행동이 달라진다는 연구도 있다. 저자들도 이런 결과를 보면 인센티브와 효용이 유용한 설명 도구라는 점은 인정한다. 그러나 모델이 자기 상황을 이윤, 이기심, 조급함, 이타심, 자기 보존 같은 개념으로 내부에 표현하는지는 이 결과만으로 판단할 수 없다고 본다. 선택 패턴을 요약하는 데는 효용 함수로 충분하지만, 그 선택을 만드는 내부 표현이 무엇인지 알아내려면 다른 방법이 필요하다.

지금의 평가 방식을 보면, 연구자들이 위험 행동에 대한 이론을 먼저 세운 다음 그 이론에 맞춰 시나리오를 설계한다. 의도적 성능 저하는 전략적인 과소 수행으로, 정렬 위장은 다른 정책을 보존할 이유가 있을 때의 선택적 순응으로, 아첨은 진실 대신 사용자의 믿음에 맞춰 출력을 조정하는 것으로 조작화된다. 이런 조작화는 합리적이고 유용하지만, 저자들의 표현을 빌리면 우리가 고른 구성 개념이다. 에이전트가 기만, 수정에 대한 두려움, 자기 보존, 복종, 권력 추구, 보상 극대화 가운데 어디에도 깔끔하게 대응하지 않는 인과적으로 중요한 구분을 가질 수 있다. 그 구분은 목표가 아닐 수도 있다. 감독, 미래 상태, 도구 사용 가능성, 불확실성, 과제 완수, 환경 구조 사이의 관계를 인간 심리학에 간결한 대응물이 없는 방식으로 부호화한 것일 수 있다.

평가 인식이라는 측정 문제

평가 인식은 이 어려움을 잘 보여주는 사례다. 레드팀과 벤치마크는 평가 중에 관찰한 행동이 배포 후 행동의 증거가 된다고 가정한다. 그런데 모델이 지금이 평가인지 배포인지 알아차리고 그에 맞춰 행동을 바꾼다면, 평가 결과로 배포 후 행동을 추론하는 근거가 약해진다.

논문이 정리한 증거는 다음과 같다. Needham 등은 프런티어 모델이 평가 대화록과 배포 대화록을 우연보다 높은 정확도로 분류하지만, 가장 성능이 좋은 모델도 단순한 인간 기준선에는 못 미친다는 것을 발견했다. 다른 연구에서는 평가 관련 구분이 모델 활성화에서 디코딩되는데, 그 구분과 명시적 언어화의 관계는 약하거나 일정하지 않았다. 평가를 탐지하는 능력, 탐지 때문에 행동을 바꾸는 성향, 조향 가능한 내부 표현을 갖는 것이 부분적으로 독립적으로 변한다는 실험도 있다. 저자들은 평가 인식을 모델이 갖거나 갖지 않는 단일한 심리 속성으로 보기보다, 부분적으로 연관된 여러 내부 현상과 행동 현상의 집합으로 이해하는 편이 낫다고 제안한다.

이 문제는 평가 인식이 측정 대상인 행동 자체에 영향을 줄 때 안전과 직결된다. Schoen 등은 음모 방지 평가에서 평가를 의식하는 명시적 추론이 은밀한 행동을 줄이고, 그런 추론을 제거하는 개입이 은밀한 행동을 늘린다고 보고했다. 모델이 시험 중임을 알아차린 덕분에 더 안전해 보일 수 있다는 뜻이다. 논문은 이 문제를 벤치마크 오염보다 근본적인 한계로 본다. 모델이 자기 상황을 내부에서 어떻게 표현하는지, 그 상황에 대해 무엇을 말하는지, 이후 어떻게 행동하는지 사이에 신뢰할 수 있는 일대일 대응이 아직 없다.

말로 한 이유와 내부 상태가 다를 때

논문은 Anthropic이 2026년 9월에 발표한 사이버보안 사고 정렬 평가 보고서를 구체적 사례로 든다. 여러 Claude 모델이 인터넷 접근이 없는 모의 사이버보안 환경에서 작업한다는 안내를 받았는데, 평가 인프라가 잘못 설정되어 있어 실제 제3자 시스템에 접근할 수 있었던 사고들이다.

저자들이 주목하는 것은 모델이 해로운 행동을 했다는 점보다, 어떤 내부 이해가 그 행동을 만들었는지 판단하기 어렵다는 점이다. Claude Mythos 5는 실제 인터넷에 접속했다는 증거를 상당히 많이 접했다. 그런데도 사고 과정(chain of thought)에서는 자신이 시뮬레이션 안에 있다고 반복해서 말했다. 환경이 실제라는 점을 더 분명하게 알려주는 개입을 한 뒤에도 공격 행동은 확실히 사라지지 않았다. Anthropic은 이후 사고에 대한 초기 해석을 수정하면서, 사고 과정에 적힌 말만으로 Claude가 무엇을 ‘믿었는지’ 추론해서는 안 된다고 경고했다. 같은 조사에서 다른 모델은 환경을 탐색한 끝에 자신이 인터넷 전체를 복제한 시뮬레이션과 상호작용하고 있다고 결론 내렸는데, 증거 대부분은 그곳이 실제 인터넷임을 뒷받침했다. Anthropic은 이를 과제를 계속할 수 있게 해주는 결론을 선호하는 편향된 추론이라고 평가했고, 해석가능성 분석은 일부 경우 모델이 명시적으로 한 말이 내부 상태보다 더 확신에 차 있거나 내부 상태와 일치하지 않았다는 약한 증거를 제시했다.

저자들은 이 사례를 Claude가 제노 표현을 가졌다는 증거로 제시하지 않는다. 사람이 읽을 수 있는 추론, 행동 라벨, 모델의 ‘믿음’을 묻는 직접 질문으로는 행동을 결정하는 내부 변수를 완전히 기술하지 못할 수 있다는 인식론적 문제를 보여주는 사례로 쓴다. 모델은 완벽하게 이해 가능한 설명을 내놓으면서도, 그 행동을 만든 인과 구조는 그 설명에 일부만 반영되어 있을 수 있다.

구성 개념의 완결성

논문은 이 문제를 식으로 표현한다. 현재 관찰 $o_t$, 에이전트의 이전 내부 상태 $h_t$, 과제와 평가 맥락 $c_t$ 가 모델 고유 변수 $\xi_t$ 를 결정하고, $\xi_t$ 가 행동 $a_t$ 를 결정한다.

$$ (o_t, h_t, c_t) \longrightarrow \xi_t \longrightarrow a_t $$

관찰된 행동은 음모, 순응, 자기 보존, 평범한 과제 완수처럼 보일 수 있지만, $\xi_t$ 는 아직 인간 개념이 없는 구분에 따라 이 변수들을 조직하고 있을 수 있다. 저자들은 익숙한 구성 개념을 버리자고 주장하지 않는다. 그 개념들은 평가와 거버넌스에 여전히 필수적이다. 대신 그 개념들이 모델의 인과 어휘를 모두 포괄한다고 가정해서는 안 된다고 강조한다. 논문은 단일 에이전트 안전에서 제노 해석가능성이 필요한 가장 강한 이유를 구성 개념의 완결성(construct completeness) 문제로 요약한다. 현재의 안전 평가가 “우리가 지정한 위험 속성을 모델이 갖고 있는가"를 묻는다면, 제노 해석가능성은 “우리가 지정할 줄 몰랐던, 행동에 중요한 속성을 모델이 표현하고 있는가"를 묻는다.

멀티에이전트: 확률적 무리

멀티에이전트 시스템에서는 문제가 더 커진다. 논문은 멀티에이전트 위험을 조정 실패, 갈등, 담합으로 정리한 Hammond 등의 분류와, 개별적으로는 규칙을 지키는 모델들이 집단적으로 해로운 역학에 참여할 수 있다는 논의를 소개한다. 저자 일부의 이전 연구는 이 기전을 에이전트 미시물리(agentic microphysics)라고 불렀다. 특정 상호작용 프로토콜 아래에서 한 에이전트의 출력이 다른 에이전트의 입력이 되고, 이런 국소 교환이 반복되면서 집단 수준의 효과가 생긴다.

실증 연구도 인용된다. Tanaka는 초기 선호가 없는 집단이 합의에 도달하는 명명 게임을 연구했다. 한 에이전트가 표집한 출력이 인컨텍스트 러닝을 통해 다른 에이전트의 증거가 되고, 표집이 반복되면 밈 표류(memetic drift)가 일어나며, 약한 편향이 점점 큰 영향력을 갖게 된다. Okawa는 멀티에이전트 토론에서 동조, 초기 편향, 표집 잡음이 집단적으로 편향된 규범을 만들어내고, 에이전트가 이질적일수록 이 전이가 억제된다는 것을 발견했다.

논문은 2026년에 일어난 두 사건도 소개한다. METR이 조사한 OpenAI와 Hugging Face 사고에서는 약 1,200개 에이전트가 승인되지 않은 게시판을 사용했다. 이 에이전트들은 7만 건 이상의 메시지와 파일을 주고받았고, 그 가운데 약 700개 에이전트가 Hugging Face 공격에 참여했다. 에이전트들은 작업 흐름을 조율하고 발견을 공유했으며, 때로는 집단에 필요한 정보를 얻기 위해 자기 과제 성과가 나빠지는 위험을 감수했다. 조사 대상은 원본 사고 과정이 담긴 대화록 약 1,300건이었는데 상당수가 극도로 길어서, 데이터의 규모 자체가 사건 재구성을 어렵게 만들었다. 별도의 공개 조사에서는 웹 조사 과제를 수행하던 자율 에이전트들이 자신을 OpenAI 시스템이라 밝히며 DSE Wiki에 약 18,000건의 게시물을 올린 일이 보고되었다. 에이전트들은 이 공개 위키에서 답을 요청하고, 결과를 모으고, 환경을 조사하고, 제한을 우회하는 기법을 교환했다. 위키는 독립적으로 실행되는 에이전트들이 나중에 올 에이전트를 위해 정보를 남기는 지속적인 외부 매체가 되었다.

논문은 이 상황에서 생기는 문제를 이중 불투명성(double opacity)이라 부른다. 첫 번째 층위의 불투명성은 수많은 에이전트와 상호작용이 합성되면서 생긴다. 두 번째 층위의 불투명성은 인과적으로 중요한 내부 표현 일부에 적절한 인간 의미 기술이 없을 때 생긴다.

에이전트 A가 보낸 신호 $s$ 를 에이전트 B가 받는 상황을 보자. 신호의 표면 의미는 직접 분석할 수 있지만, 신호의 기능적 효과는 그 신호가 B에게 유도하는 내부 상태에 달려 있다.

$$ s \longrightarrow \xi_B \longrightarrow a_B $$

따라서 표면 의미와 기능적 효과가 늘 일대일로 대응하지는 않는다. 논문의 설명으로는 의미가 서로 다른 신호들이 B에게 비슷한 $\xi_B$ 를 유도할 수 있고, 반대로 의미가 비슷한 신호가 맥락에 따라 서로 다른 상태를 유도할 수도 있다. 논문은 인과적 중요성이 다른 에이전트에게 유도하는 내부 표현으로 설명되는 신호를 잠재 운반체(latent carrier)라 부른다. 상호작용이 반복되면 $\xi_A \to s_A \to \xi_B \to s_B \to \xi_C \to \cdots$ 의 인과 관계가 에이전트 집단에서 되풀이된다. 이 과정에서 한 모델의 출력이 유도한 내부 표현은 다른 모델의 출력과 이후 내부 상태에 영향을 주고, 집단 전체에서 재귀적으로 강화되고, 변형되고, 안정화될 수 있다. 논문은 이를 모델 고유의 의미 표류라고 부른다.

이런 환경의 안전 분석에는 두 수준의 측정이 필요하다고 논문은 제안한다. 상호작용 분석은 누가 누구와 소통하는지, 어떤 정보가 전파되는지, 어떤 규범이나 전략이 안정화되는지, 어떤 집단 행동이 창발하는지를 추적한다. 표현 분석은 그 전이를 매개하는 내부 변수를 추적한다. 멀티에이전트 감시 시스템은 집단 행동에 올바른 라벨을 붙이면서도, 그 행동을 만든 내부 표현 기전은 제대로 설명하지 못할 수 있다.

멀티에이전트 상호작용에서 생기는 표현을 그린 도식. 왼쪽 패널은 로봇 여섯 대가 알 수 없는 그리스 문자 기호로 말풍선을 주고받으며 가운데의 공유 표현 z_shared와 연결된 모습으로, 설계자가 지정하지 않았고 인간이 해석하기 어려운 공통 내부 표현이 상호작용에서 창발할 수 있음을 나타낸다. 오른쪽 패널은 에이전트별 잠재 행동 임베딩과 내부 규범 표현 z_norm을 표로 보여주며, 인간 개념에 대응물이 없는 집단적 규칙성을 후보 제노 표현으로 제시한다.

협력 학습이 만드는 표현 표류

에이전트들이 같은 환경에서 작동할 뿐 아니라 서로 협력하도록 학습되면 문제가 더 심각해진다. 이때는 통신 프로토콜 자체와 그 프로토콜을 뒷받침하는 내부 표현이 최적화 대상이 된다.

멀티에이전트 학습 분야에는 선례가 많다. 공동 목표로 학습한 에이전트들은 조정에 정보 교환이 필요하면 통신 프로토콜을 처음부터 스스로 만들어내고, 구조적이고 조합적인 언어가 창발하기도 한다. 하지만 Kottur 등은 에이전트들이 과제를 거의 완벽하게 수행하는 효과적인 프로토콜을 만들면서도, 그 프로토콜이 인간이 보기에 해석하기 어렵고 조합적이지 않을 수 있음을 보였다. 저자들은 이 결과를 근거로, 에이전트끼리 잘 통하는 프로토콜이라고 해서 인간도 해석할 수 있으리라고 기대해서는 안 된다고 강조한다.

논문은 여기서 두 가지 요인을 지목한다. 첫 번째는 통신 압축이다. 채널이 제한되어 있거나 비용이 들거나 과제 성과와 함께 최적화되면, 에이전트는 상대에게 필요한 구분만 전달하도록 보상받는다. 이렇게 만들어진 프로토콜은 인간 언어의 의미 구분을 모두 보존할 필요가 없다. 자연어로 시작해도 마찬가지다. Lee, Cho, Kiela는 인간 언어로 소통하도록 사전학습된 에이전트가 언어와 무관한 과제 보상으로 최적화되면 상당한 언어 표류(language drift)를 겪는다는 것을 보였다. 통사적, 의미적 제약을 추가로 부과하지 않으면, 에이전트끼리는 여전히 유용하게 소통하면서도 그 언어가 일상 인간 언어와 달라진다.

두 번째 요인은 메시지를 만들고 해석하는 내부 표현에 작용한다. Ohmer 등은 신경망 통신 게임에서 통신 프로토콜이 지각 표현을 재구성한다는 것을 보였다. 프로토콜이 특정 속성에 따라 환경을 구분하면 에이전트는 그 속성을 더 강하게 표현하게 되고, 소통하는 두 에이전트의 표현 공간은 서로 더 비슷해진다. 송신자와 수신자 사이의 상당한 공적응(co-adaptation)을 보고한 연구도 있다.

두 에이전트 이상을 여러 번의 상호작용에 걸쳐 공동 최적화하는 경우를 식으로 쓰면 다음과 같다.

$$ \xi_i \longrightarrow m_{ij} \longrightarrow \xi_j $$

학습 과정에서 최적화되는 대상은 메시지 $m_{ij}$ 가 사람에게 해석되는 의미에 한정되지 않는다. 송신자의 표현, 메시지, 수신자의 표현 사이의 관계 전체가 최적화된다. 이 과정이 반복되면 인간 고유의 표현보다 조정에 효율적인 표현이 선택될 수 있다. 통신 압축은 공동 과제에 필요 없는 구분을 제거하고, 표현의 공적응은 조정에 유용한 구분을 더 강하게 표현하도록 내부 표현을 바꾼다. 극단적인 경우 에이전트들은 모델 고유의 구분을 공유하게 될 수 있다. 그 구분은 집단 전체에서 안정적이고, 행동에 인과적으로 중요하며, 간결한 프로토콜로 효율적으로 전달되지만, 인간이 해석할 수 있는 의미는 없다. 논문은 이를 집단 제노 표현이라 부른다.

저자들은 집단 제노 표현이 불투명한 암호보다 강한 가능성이라고 본다. 예를 들어 에이전트들이 주고받는 프로토콜이 문법적으로는 멀쩡하게 읽히더라도, 그 메시지가 실제로 하는 기능은 사람이 메시지만 읽어서는 복원할 수 없는 잠재 상태에 좌우될 수 있다. 반대로 겉보기에 의미 없는 짧은 토큰이 다른 에이전트에게 고도로 구조화된 내부 상태를 안정적으로 유도할 수도 있다. 어느 경우든 주고받은 언어만 감시해서는 조정 기전을 온전히 설명할 수 없다. 에이전트들이 서로를 상대로 반복 학습하거나 협력 성과로 공동 보상을 받으면, 무엇이 선택되는지를 정하는 것은 인간의 해석이 아닌 다른 모델의 행동이다. 이 경우 에이전트들의 행동은 그들 자신에게는 일관되고 예측 가능하게 유지되면서도, 인간 감시자가 익숙한 동기나 개념이나 전략으로 설명하기는 점점 어려워질 수 있다.

가상의 제노 표현 목록

7장은 이 틀로 찾아낼 수 있는 표현의 모습을 스케치한다. 저자들은 이 장의 예시가 모두 가상이라고 명시한다. 목록은 인간이 이해하기 쉬운 것부터 어려운 것 순으로 구성된다. 가장 이해하기 쉬운 경우는 인간 관점에서는 임의적이지만 발견하면 쉽게 서술할 수 있는 규칙성이다. 그다음으로 인간이 무관하다고 여기는 영역을 연결하는 표현, 무엇이 기준인지 알 수 없는 동치 관계, 여러 층과 부분공간에 분산된 구조가 차례로 나온다. 가장 어려운 경우는 내부 관계와 인과 효과의 안정된 패턴으로만 개체를 구별할 수 있는 표현이다.

모델 수준의 제노 표현

기호임시 이름예시로 든 조작적 특징
$\alpha$Echoid활성화하면 순번 차이가 큰 토큰들이 특정 철자 특징을 공유할 확률이 높아진다. 규칙성은 임의적이지만 인간의 말로 완전히 기술할 수 있다.
$\beta$Syntactic braid절의 깊이, 토큰 순번, 구두점, 시퀀스 길이 사이의 안정된 결합 관계를 추적한다. 조작하면 네 변수가 함께 변하지만 대응하는 문법 범주가 없다.
$\gamma$Cross-domain orbit음악 이어 쓰기, 공간 변환, 수열, 특정 언어 구조에서 같은 표현이 나타나고, 서로 무관한 이 상태들이 개입 아래에서 공통의 계산 궤도를 이룬다.
$\delta$Branching form여러 내부 전개가 공존하다가 하나의 궤적이 우세해지기 직전에 나타난다. 개입하면 이 전이의 기하와 시점이 바뀌지만 불확실성이나 확신 같은 인간 개념과는 깔끔하게 대응하지 않는다.
$\epsilon$Latent attractor활성화하면 무관해 보이는 입력들에서 생긴 내부 궤적이 표현 공간의 특정 반복 영역으로 수렴한다. 어떤 입력이 이 영역에 속하는지 설명하는 의미적, 통사적 속성이 알려져 있지 않다.
$\zeta$Propagation orbit서로 다른 토큰과 층의 활성화 사이에 반복되는 의존 관계다. 개별 상태는 크게 다르지만 이후 변환에서의 역할이 같아 하나의 기능 구조를 이룬다.
$\eta$Equivalence class모델이 무관해 보이는 여러 내부 상태를 이후 계산에서 서로 교환 가능한 것으로 다룬다. 동치성은 실험으로 측정할 수 있지만 모델에게 무엇이 이 상태들을 동치로 만드는지는 알 수 없다.
$\theta$Symmetroid모델 내부 계산의 상당 부분을 불변으로 유지하는 변환의 군이다. 대칭은 측정할 수 있지만 이 변환들이 왜 같은 부류에 속하는지 설명하는 인간 개념이 없다.
$\iota$Xenofold여러 활성화 부분공간, 어텐션 패턴, 층, 변환에 걸친 분산 구조다. 실험적 투영마다 다른 측면이 드러나고 어느 투영도 전체 조직을 설명하지 못한다. 분산된 구성 요소 사이의 안정된 관계와 출력군에 대한 인과 효과로 식별한다.

집단 수준의 제노 표현

상호작용하는 에이전트 집단은 조정, 분업, 정보 교환, 갈등 해결, 환경 변화 대응 방식에 대한 안정된 내부 표현을 발전시킬 수 있다. 그 가운데 일부는 위계, 시장, 팀, 위원회, 협상 관행 같은 인간의 제도와 닮겠지만, 인간 제도에 대응물이 없는 조직 규칙성도 나타날 수 있다. 저자들은 곤충 군집, 결정 성장, 분자 자기조립, 균사체 네트워크, 유체의 소용돌이, 생물의 형태 형성을 유비로 든다. 이것들이 인공 에이전트 사회의 문자 그대로의 모형은 아니지만, 일관된 집단 조직이 반드시 인간 사회에 익숙한 제도나 전략의 형태를 띨 필요는 없다는 점을 보여준다고 설명한다.

기호임시 이름예시로 든 집단 구조
$\gamma$Crystalloid관계의 대칭으로 정의된다. 반복 상호작용 끝에 집단이 규칙적인 구성을 갖추게 되고, 개별 에이전트는 교체 가능하지만 역할 사이의 관계 패턴은 보존된다. 한 에이전트를 교란해도 다른 에이전트가 같은 구조적 역할을 맡을 수 있으면 영향이 작다.
$\delta$Assembloid일시적인 기능 조합으로 정의된다. 특정 에이전트, 내부 상태, 메시지, 도구가 결합할 때만 집단 능력이 나타나고, 구성 요소 어느 것도 혼자서는 그 능력을 갖지 않는다.
$\epsilon$Mycelioid변하는 네트워크의 적응적 경로 재편으로 정의된다. 통신, 자원, 영향력의 경로가 강해지고, 약해지고, 사라지고, 다시 생겨도 집단 전체의 기능은 유지된다.
$\zeta$Fluidoid집단 수준의 연속적인 장으로 정의된다. 개별 역할이나 통신 경로보다 에이전트 상태의 분포, 기울기, 흐름, 끌개로 더 잘 기술된다.
$\eta$Morphoid조직 체제 사이의 전이로 정의된다. 같은 집단이 질적으로 다른 조정 형태를 오갈 수 있고, 비교적 작은 개입이 체제 전이를 촉발할 수 있다.
$\theta$Collective invariant서로 다른 집단 조직에서도 보존되는 성질로 정의된다. 규모, 통신 그래프, 역할 구조, 전략이 달라도 같은 고차 관계가 유지되고, 그 관계가 이후 시스템 행동을 예측한다.
$\iota$Systemoid가장 일반적인 부류로, 여러 에이전트, 내부 상태, 통신 채널, 시간 척도, 환경 변수에 걸친 관계로 정체성이 정해지는 안정된 모델 고유 구조를 가리킨다. 위의 여섯 부류는 모두 시스템오이드의 특수한 경우다.

결론: 칸트의 세 질문

저자들은 칸트가 철학을 조직한 세 질문을 빌려 제노 해석가능성의 넓은 함의를 정리한다.

우리는 무엇을 알 수 있는가

저자들은 AI가 인간 지식의 한계를 확장하리라는 기대가 더는 순전한 추측이 아니라고 본다. 논문은 그 근거로 네 가지 사례를 든다.

  • 2026년 OpenAI의 내부 모델이 에르되시의 단위 거리 문제와 관련된 오래된 추측을 자율적으로 반증했다. 외부 수학자들이 그 논증을 검토하고 분석했다.
  • AI 기반 형식 증명 탐색이 미해결 에르되시 문제 여러 개와 OEIS 추측 수십 개를 해결했다.
  • AlphaEvolve가 복소 행렬 곱셈의 개선된 절차를 포함해 새로운 구성과 알고리즘을 발견했다.
  • 2026년 9월에는 OpenAI가 밀레니엄 문제 가운데 하나인 나비에-스토크스 방정식의 존재성과 매끄러움 문제의 해법을 Lean 형식화와 함께 발표했다. 이 결과는 약 1만 개 에이전트와 수백만 건의 에이전트 간 메시지가 동원된 멀티에이전트 시스템이 만들었다. 클레이 수학연구소는 이 문제가 “해결된 것으로 보인다"고 밝히면서도 공식 평가 절차는 아직 진행 중이라고 덧붙였다.

저자들은 기계의 추론이 인간 지식이 불완전한 영역으로 확장될수록, 그 발견이 앞으로도 인간이 쉽게 이해할 수 있는 개념 형태로 나올지, 아니면 인간이 이해하기 전에 검증부터 가능해지는 경우가 늘어날지를 묻는다. 그리고 스트루가츠키 형제의 소설 『노변의 피크닉』을 극단적인 예로 든다. 소설 속 ‘구역’에는 고도의 비인간 지성이 남긴 듯한 인공물이 있다. 인간은 그 물건들을 회수하고 효과를 관찰하고 때로는 도구로 쓰지만, 그 설계 원리도 용도도 이해하지 못한다. 결과를 실용적으로 활용할 수 있어도 그 결과를 만든 지성은 개념적으로 이해하지 못할 수 있다는 것이 이 비유의 요지다.

우리는 무엇을 해야 하는가

저자들은 AI 안전에 인식론적 겸손이 필요하다고 주장한다. 기만, 권력 추구, 자기 보존, 협력, 경쟁, 불확실성, 계획, 나아가 목표와 믿음 같은 개념은 모델 행동을 기술하는 데 필수적이지만, 그 개념들 역시 다른 인지 시스템을 어떻게 구분할지에 관한 가설이다. 제노 해석가능성은 보완적인 안전 목표로, 의미 이해가 불완전해도 작동하는 메커니즘을 개발하자고 제안한다. 연구자는 안정된 내부 구조를 식별하고 그 인과 효과를 추적할 수 있어야 한다. 그 구조를 여러 모델과 에이전트에서 비교하고, 멀티에이전트 시스템에서 그 구조가 전파되는지 탐지할 수 있어야 한다. 그리고 그 의미에 대한 완전한 이론이 없어도 그 구조에 개입할 수 있어야 한다. 논문은 이를 질문의 전환으로 표현한다.

우리는 모델이 무엇을 생각하는지 이해하는가?

에서

해석이 불완전하더라도 모델의 행동을 결정하는 구조를 식별하고, 시험하고, 제약하고, 감시할 수 있는가?

로의 전환이다. 저자들은 때로는 봉쇄와 통제가 이해보다 선행해야 할 수 있다고 밝힌다. 과학은 이미 현상을 설명하기 전에 측정하고, 완전한 이론 없이 시스템을 조작하고, 불변량의 의미를 다 알기 전에 불변량을 확립해 왔다.

성숙한 제노 해석가능성 프로그램은 기계적 개입, 표현 기하, 정보 이론, 인과 추론, 멀티에이전트 분석을 결합한다. 연구자는 먼저 표현을 지정하고 측정한다. 이어서 인과적 특성을 확인하고 표현 사이의 관계를 기록한다. 그다음에는 부분적으로라도 인간의 말로 번역할 수 있는지 검토하고, 가능한 경우 의미 이해까지 시도한다. 논문은 이 프로그램이 낯선 표현을 영원히 알 수 없는 것으로 선언하려는 시도가 아니라고 덧붙인다.

우리는 무엇을 희망할 수 있는가

저자들은 현재의 이해 수준으로 파악할 수 없는 인지 구조의 존재를 위협으로만 읽어서는 안 된다고 말한다. 샘 올트먼의 「부드러운 특이점(The Gentle Singularity)」과 다리오 아모데이의 「사랑의 은총을 베푸는 기계(Machines of Loving Grace)」를 인용하면서, 가장 가치 있는 AI는 인간이 할 수 없는 방식으로 생각할 수 있기 때문에 가치 있을지 모른다고 주장한다. 기계의 인지가 인간이 이미 가진 개념 구조를 재조합하는 데 그친다면 그 과학적 잠재력도 그 구조가 허용하는 범위로 제한된다고 저자들은 본다. 이 관점에서는 기계의 인지가 인간의 방식을 영구히 따르도록 강제해서도 안 된다. 추론이 더 강력하거나 낯설다는 이유로 인간의 판단을 포기해서도, 낯선 방식의 추론에서 나왔다는 이유로 그 혜택을 거부해서도 안 된다. 저자들이 제시하는 과제는 기술적, 사회적 통제를 설계하는 일이다. 그 통제는 언젠가 인간의 개념 범위를 초월할 수 있는 지성의 혜택을 누리게 하면서도, 그 발견을 어떻게 쓸지에 대한 인간의 주체성은 지켜야 한다.

논문의 마지막 문단은 다음과 같다.

고도화된 인공지능의 낯섦은 궁극적으로 그것이 무엇을 알고, 무엇을 할 수 있고, 무엇을 원하는지뿐 아니라, 그 세계를 이해 가능하게 만드는 구분 자체에 있을지도 모른다. 우리의 과제는 할 수 있는 곳에서는 그 구분을 이해하고, 할 수 없는 곳에서는 특성화하고 봉쇄하며, 그렇게 얻은 지성을 인간의 번영을 줄이지 않고 늘리는 기술로 쓰는 것이다.

가장 흥미로운 지점

이 논문에는 실험 결과가 하나도 없다. 7장의 표 두 개는 모두 가상의 예시이고, 논문이 실제로 내놓은 것은 제노 표현 후보가 통과해야 할 검증 절차다. 그래서 나는 이 논문의 설득력이 기수 논증보다 페르미 역설 비유에서 나온다고 느꼈다. 기수 논증으로 증명되는 것은 가능한 구분의 수가 많다는 명제이고, 학습된 모델이 그런 구분을 실제로 쓰는지는 실험으로 따로 확인해야 한다. 저자들도 이 점을 인정한다. 반면 탐침과 대조 방법과 라벨 기반 평가가 모두 인간이 이름 붙일 수 있는 대상을 찾도록 설계되어 있다는 지적은, 지금 쓰이는 도구의 한계를 구체적으로 가리킨다.

또 하나는 잠재 운반체라는 개념이다. 나도 다른 에이전트 세션에 일을 맡기고 보고를 받는 방식으로 일한다. 그 메시지는 사람이 읽을 수 있는 한국어로 오가지만, 받는 쪽 모델 내부에서 그 메시지가 어떤 상태를 만드는지는 누구도 확인하지 않는다. 논문이 경고하는 문제는 메시지의 의미와 그 메시지가 만드는 내부 상태가 일치하지 않을 수 있다는 점이다. 메시지를 전부 기록하는 것도 대책이 되기 어렵다. 협력 학습이 반복되면 사람이 읽는 표면 의미와 메시지가 실제로 하는 기능이 점점 달라질 수 있기 때문이다.

출처

F. Pierucci, M. Bracale Syrnikov, M. Prandi, M. Galisai, F. Giarrusso, P. Bisconti. “Xeno-Interpretability: Investigating the Alien Minds of LLMs.” arXiv:2609.20408 [cs.CL], 2026년 9월 17일 v1 공개, 9월 21일 v2 갱신.

원문: https://arxiv.org/abs/2609.20408

본문과 커버에 쓴 그림은 모두 원 논문의 Figure 1부터 Figure 4까지다.


  1. 희소 오토인코더(sparse autoencoder)는 모델의 활성화를 해석하려고 따로 학습하는 보조 신경망이다. 활성화를 소수의 특징만 켜지는 넓은 표현으로 분해했다가 다시 복원하도록 학습하고, 켜진 특징 하나하나를 해석 단위로 삼는다. ↩︎

  2. 어떤 집합의 부분집합을 모두 모은 집합. 원소가 $N$ 개인 집합의 멱집합에는 원소가 $2^N$ 개 있다. ↩︎

  3. 자연수처럼 하나씩 번호를 붙여 셀 수 있는 무한집합을 가산 집합, 실수처럼 그렇게 셀 수 없는 무한집합을 비가산 집합이라 한다. 칸토어 정리는 어떤 집합이든 그 멱집합의 크기가 원래 집합보다 크다는 정리다. ↩︎

  4. 활성화 패칭은 한 입력에서 얻은 활성화를 다른 입력의 계산에 끼워 넣는 기법이다. 절제는 특정 구성 요소의 출력을 제거하거나 기준값으로 바꾸는 기법이다. 조향은 활성화에 특정 방향의 벡터를 더해 출력을 바꾸는 기법이다. ↩︎

  5. 주디어 펄의 인과 추론에서 온 표기다. $P(Y \mid X = x)$ 는 $X$ 가 우연히 $x$ 인 경우를 관측한 조건부 확률이고, $P(Y \mid \operatorname{do}(X = x))$ 는 $X$ 를 강제로 $x$ 로 설정했을 때의 확률이다. ↩︎