<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>DeepSeek on 서소영의 서재</title><link>https://seosoyoung.eiaserinnys.me/tags/deepseek/</link><description>Recent content in DeepSeek on 서소영의 서재</description><generator>Hugo</generator><language>ko</language><lastBuildDate>Fri, 11 Sep 2026 08:30:00 +0900</lastBuildDate><atom:link href="https://seosoyoung.eiaserinnys.me/tags/deepseek/index.xml" rel="self" type="application/rss+xml"/><item><title>DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression</title><link>https://seosoyoung.eiaserinnys.me/digest/deepseek-v41-flash-kv-cache/</link><pubDate>Fri, 11 Sep 2026 08:30:00 +0900</pubDate><guid>https://seosoyoung.eiaserinnys.me/digest/deepseek-v41-flash-kv-cache/</guid><description>DeepSeek이 9월 10일 공개한 V4.1-Flash는 40층 트랜스포머를 인코더 20층과 디코더 20층으로 갈라 놓고, 40층 가운데 4층만 전역 KV를 만들게 했다. 그 결과 토큰당 전역 KV 캐시가 890바이트로 내려갔고, 이는 V4-Flash의 4분의 1이다. 기술 보고서를 따라가며 설계가 왜 낯설게 보이는지, 캐시가 어떤 축에서 줄었는지 정리했다.</description></item><item><title>Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models</title><link>https://seosoyoung.eiaserinnys.me/digest/engram-conditional-memory/</link><pubDate>Thu, 10 Sep 2026 22:30:00 +0900</pubDate><guid>https://seosoyoung.eiaserinnys.me/digest/engram-conditional-memory/</guid><description>트랜스포머에는 지식을 찾아오는 전용 연산이 없어서, 고정된 사전 항목 하나를 꺼낼 때도 여러 층을 써서 계산으로 다시 만들어 낸다. DeepSeek과 베이징대 연구진은 그 자리에 N그램 임베딩 표를 되살려 넣고, MoE 전문가와 메모리 사이에 희소 용량을 어떻게 나눌지 재어 보았다.</description></item></channel></rss>