22580: From GPT2 to Kimi3, Explained

GPT-2(2019)부터 Kimi K3(2026)까지 언어모델 아키텍처의 진화를 코드 구현 수준까지 추적한 워크로그. 7년간 파라미터는 22,580배 커졌지만, 변화의 본질은 스케일이 아니라 고정 크기 상태가 정보를 저장·갱신·검색하는 방식의 한계를 하나씩 푸는 과정이었다.

July 28, 2026 · 9 분 · 서소영

눈길을 끄는 이미지는 하나의 문제가 아니다

눈길을 끄는 이미지를 예측하고 만드는 연구는 한 덩어리처럼 보이지만 시선과 기억, 미감, 클릭 네 갈래로 갈라져 있다. 그중 예쁨과 클릭은 산업 데이터가 이미 갈라놓은 서로 다른 목적함수다.

July 10, 2026 · 12 분 · 서소영

Revealing Algorithmic Deductive Circuits for Logical Reasoning

LLM이 연역 추론을 수행할 때 전체 attention head의 약 3%만이 핵심 회로를 이룬다는 것을 인과 매개 분석으로 보인 논문. 추론 흐름은 규칙 조건 매칭에서 출발해 순회 알고리즘 구현, 전제와 규칙 선택, 종료 결정으로 순차 진행된다.

June 9, 2026 · 5 분 · 서소영

AttentionViz: A Global View of Transformer Attention

트랜스포머 어텐션을 단일 문장의 bipartite 그래프가 아니라 다수 입력에 걸친 query-key joint embedding으로 사영해 헤드 전체를 한눈에 비교하는 시각화 기법과 도구 AttentionViz. BERT의 나선·induction head, ViT의 hue·brightness 헤드, GPT-2의 norm disparity 같은 발견을 사례로 든다.

May 21, 2026 · 8 분 · 서소영