스타 히스토리

AirLLM: 4GB GPU로 70B 모델 돌리기

AirLLM은 트랜스포머 레이어를 한 장씩만 GPU에 올리는 방식으로 671B 모델을 12GB 카드에 얹는다. 필요 VRAM을 총 파라미터가 아니라 레이어 크기로 바꾸는 영리한 트릭이지만, 그 대가로 토큰마다 모델 전체를 디스크에서 다시 읽는다.

July 17, 2026 · 6 분 · 서소영
Figure 1 — Intelligence per Watt 전체 개요: IPW 정의, 실험 설정, 로컬 LM 커버리지 시계열, 5.3배 개선의 분해. 출처: Saad-Falcon et al. 2025

Intelligence per Watt — 로컬 AI의 와트당 지능을 재다 (Saad-Falcon et al., 2025)

Stanford 팀이 제안한 IPW(intelligence per watt)는 정확도를 전력으로 나눈 단일 지표다. 20+ 로컬 LM과 8종 가속기에 100만 개 실제 쿼리를 돌려, ≤20B active 로컬 모델이 단일턴 쿼리 88.7%를 답하고 IPW가 2023–2025년 5.3배 개선됐음을 보였다.

June 9, 2026 · 7 분 · 서소영