
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
휴대폰으로 대충 찍은 단안 영상 한 편에서 자유 시점 4D 인간을 복원한다. 시점 수를 수십 개로 늘리면 일관성이 무너지던 원인을 어텐션 컨텍스트 용량 한계로 규명하고, 참조 컨텍스트 압축과 타깃 그룹 회전이라는 두 설계로 푼다.

휴대폰으로 대충 찍은 단안 영상 한 편에서 자유 시점 4D 인간을 복원한다. 시점 수를 수십 개로 늘리면 일관성이 무너지던 원인을 어텐션 컨텍스트 용량 한계로 규명하고, 참조 컨텍스트 압축과 타깃 그룹 회전이라는 두 설계로 푼다.

사진 한 장에서 UE5나 Blender가 그대로 불러올 수 있는 오브젝트와 광원을 뽑아내는 벤치마크 Lumera. 3D 박스 파싱은 기존 방법을 크게 앞섰지만, 개별 광원의 위치 추정은 F1 0.209에 머물러 있다.

여러 장의 실내 사진에서 방의 벽·바닥·천장을 3D 다각형으로 복원하는 ECCV 2026 논문. 방을 하나씩 따로 풀지 않고 건물 안의 방들이 같은 방향과 같은 층고를 공유한다는 구조를 최적화에 넣어, 직육면체 가정에 묶여 있던 기존 방법을 큰 폭으로 앞선다.

아이폰 LiDAR 스캔 한 번을 편집 가능한 3D 실내 씬으로 바꾸는 오픈소스 에이전트 시스템. 씬 전체를 하나의 파이썬 프로그램으로 두고, 에이전트가 raw 메시가 아니라 코드를 고쳐 가며 실제 촬영본에 맞춰 나간다.