
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
휴대폰으로 대충 찍은 단안 영상 한 편에서 자유 시점 4D 인간을 복원한다. 시점 수를 수십 개로 늘리면 일관성이 무너지던 원인을 어텐션 컨텍스트 용량 한계로 규명하고, 참조 컨텍스트 압축과 타깃 그룹 회전이라는 두 설계로 푼다.

휴대폰으로 대충 찍은 단안 영상 한 편에서 자유 시점 4D 인간을 복원한다. 시점 수를 수십 개로 늘리면 일관성이 무너지던 원인을 어텐션 컨텍스트 용량 한계로 규명하고, 참조 컨텍스트 압축과 타깃 그룹 회전이라는 두 설계로 푼다.

흔들린 사진 한 장을 사전학습 비디오 확산 모델에 조건으로 넣어, 셔터가 열려 있던 순간의 영상과 그 직전과 직후까지 생성한다. 요크대학교와 토론토대학교 연구진의 SIGGRAPH Asia 2025 논문.

Celeris AI Labs가 확산 기반 추론 아키텍처로 만든 첫 모델 Celeris-1을 공개했다. GPT-5에 근접한 지능을 유지하면서 응답 지연을 15배 이상 줄이고, 초당 1,600토큰대의 생성 속도를 낸다고 주장한다.
Rocky Ding이 2026년 3월 정리한 약 7만 자 분량의 종합 해설. FLUX.2·Seedream·Z-Image·GLM-Image 네 AIGC 이미지 대모델의 VAE·텍스트 인코더·DiT 백본·학습/추론 최적화를 분해하고, GRPO 알고리즘의 AIGC 적용까지 다룬다. 글의 메타 주장은 2025년 하반기를 AIGC 이미지 창작 영역의 ‘하프타임’으로 규정하고, 단일 문생도 모델은 가치가 사라지며 통합 멀티모달과 ‘주기 횡단’ 가치를 가진 기술만 살아남는다는 것이다.

엔드투엔드 역전파의 메모리 병목을, 트랜스포머의 잔차 연결이 확산 모델 ODE의 이산화와 같다는 통찰로 푼 논문. 네트워크를 노이즈 구간별 독립 블록으로 쪼개 한 번에 한 블록만 학습하니 메모리가 블록 수만큼 줄고, 5개 아키텍처에서 엔드투엔드에 필적했다.