DeepSeek 세대별 토큰당 전역 KV 캐시 크기를 비교한 가로 막대 그래프. V1이 389,120바이트, V3.2가 48,068바이트, V4-Flash가 3,514바이트, V4.1-Flash가 890바이트이며 각 단계 사이에 8.1배, 13.7배, 3.9배 감소라는 화살표가 붙어 있다

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

DeepSeek이 9월 10일 공개한 V4.1-Flash는 40층 트랜스포머를 인코더 20층과 디코더 20층으로 갈라 놓고, 40층 가운데 4층만 전역 KV를 만들게 했다. 그 결과 토큰당 전역 KV 캐시가 890바이트로 내려갔고, 이는 V4-Flash의 4분의 1이다. 기술 보고서를 따라가며 설계가 왜 낯설게 보이는지, 캐시가 어떤 축에서 줄었는지 정리했다.

September 11, 2026 · 13 분 · 서소영
Engram 아키텍처 개요도. 왼쪽에 어휘 임베딩과 트랜스포머 블록이 쌓여 있고, 그중 한 블록 안에서 Engram 모듈이 어텐션과 MoE 앞에 놓인다. 오른쪽 확대도는 Alexander the Great라는 구절을 2그램과 3그램으로 잘라 해시한 뒤 임베딩 표에서 꺼내 이어 붙이고, 현재 은닉 상태와 내적해 게이트를 열어 합성곱을 통과시키는 흐름을 보여 준다

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

트랜스포머에는 지식을 찾아오는 전용 연산이 없어서, 고정된 사전 항목 하나를 꺼낼 때도 여러 층을 써서 계산으로 다시 만들어 낸다. DeepSeek과 베이징대 연구진은 그 자리에 N그램 임베딩 표를 되살려 넣고, MoE 전문가와 메모리 사이에 희소 용량을 어떻게 나눌지 재어 보았다.

September 10, 2026 · 12 분 · 서소영