어텐션 헤드 하나를 구현하는 하드웨어 도판. 왼쪽 a는 게인 셀 배열 두 개와 HardSigmoid 회로, 카운터로 이뤄진 하위 타일 16개의 결과를 디지털 가산기가 합산하는 블록도다. 오른쪽 위 b는 가로 1,200μm인 실제 칩 레이아웃이고, 아래 c와 d는 가로 70μm, 세로 240μm인 하위 타일 하나의 평면도와 게인 셀 배선 확대도다. 출처: Leroux et al., Nature Computational Science (2025), CC BY 4.0

Analog in-memory computing attention mechanism for fast and energy-efficient large language models

독일 율리히 연구소 연구진이 KV 캐시를 저장하는 게인 셀 배열에서 어텐션 연산까지 아날로그로 처리하는 인메모리 컴퓨팅 아키텍처를 제안했다. 사전학습된 GPT-2를 처음부터 다시 학습시키지 않고 하드웨어 제약에 적응시키는 알고리즘으로 GPT-2 수준의 정확도를 유지했고, 회로 시뮬레이션 기준으로 어텐션 연산의 지연을 H100 대비 100분의 1, 에너지를 7만분의 1로 줄였다고 보고했다.

September 25, 2026 · 13 분 · 서소영