교차 모델 KV 캐시 전이 파이프라인 도식. 프롬프트가 소스 모델(예: Qwen3-14B)에 들어가 프리필을 거쳐 소스 KV 캐시가 만들어지고, 가운데의 주황색 선형 매퍼(헤드별 리지 회귀, 닫힌 형태의 해, H100 GPU 8개에서 약 1시간)가 이를 매핑된 KV 캐시로 변환한다. 타깃 모델(예: Qwen3-32B)은 매핑된 캐시로 프리필 없이 디코딩을 시작해 답을 생성한다. 프롬프트에서 타깃 모델로 가는 회색 점선에는 타깃 프리필(제거됨)이라는 라벨이 붙어 있다.

Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

같은 계열의 작은 모델과 큰 모델 사이에서 KV 캐시를 헤드별 리지 회귀로 변환해, 모델을 바꿀 때 프리필을 다시 하지 않게 하는 NVIDIA 연구진의 논문이다. 세 계열 여섯 쌍 가운데 네 쌍이 타깃 단독 정확도의 73%에서 98%를 유지했고, 변환은 다시 프리필하는 것보다 2.7배에서 25배 빨랐다.

September 24, 2026 · 17 분 · 서소영