
An endless AI TV channel on a single gaming GPU
게이밍 GPU 한 장으로 끊기지 않는 AI 영상 채널을 돌린 기록이다. 19.2초의 GPU 시간으로 20.1초 분량의 영상을 만들어 재생 버퍼가 마르지 않게 했고, 모델은 그대로 두고 ComfyUI의 노드별 실행 시간을 계측해 얻은 속도다.

게이밍 GPU 한 장으로 끊기지 않는 AI 영상 채널을 돌린 기록이다. 19.2초의 GPU 시간으로 20.1초 분량의 영상을 만들어 재생 버퍼가 마르지 않게 했고, 모델은 그대로 두고 ComfyUI의 노드별 실행 시간을 계측해 얻은 속도다.

Moonshot의 2.78조 파라미터 멀티모달 MoE, Kimi K3를 Apple의 MLX 프레임워크로 옮긴 포트. 39개 테스트를 모두 통과하고 mxfp4 티어는 원본과 비트 단위로 일치하지만, 정작 이 모델은 지구상 어떤 맥에서도 한 토큰조차 만들어낸 적이 없다.

AirLLM은 트랜스포머 레이어를 한 장씩만 GPU에 올리는 방식으로 671B 모델을 12GB 카드에 얹는다. 필요 VRAM을 총 파라미터가 아니라 레이어 크기로 바꾸는 영리한 트릭이지만, 그 대가로 토큰마다 모델 전체를 디스크에서 다시 읽는다.

구글 리서치의 TurboQuant 양자화 알고리즘을 Rust로 구현한 벡터 인덱스. 학습 단계 없이 벡터를 16배로 압축하고, 손수 짠 SIMD 커널로 FAISS보다 빠르게 검색한다.