왼쪽은 GPT-2 200개, LLaMA3-8B, ViT 500개, Flan-T5 8개 모델의 주성분별 설명 분산이 앞쪽 몇 개에서 급격히 꺾이는 3차원 막대그래프이고, 오른쪽은 무작위 초기화된 ViT 500개의 평평한 스펙트럼과 학습 후 같은 모델들의 뾰족한 스펙트럼을 위아래로 견준 그림

The Universal Weight Subspace Hypothesis

존스홉킨스 연구진은 1,100개가 넘는 공개 모델의 가중치를 층별로 분해했다. 서로 다른 데이터와 초기값으로 학습했어도 구조가 같은 모델은 열여섯 개 안팎의 공통 방향에 분산 대부분이 모였다. ViT 500개는 이 공통 부분공간 하나와 계수로 대신하고, 새 과제는 계수 1만 개만 학습해 풀었다.

September 16, 2026 · 9 분 · 서소영