
SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference
희소 어텐션은 어떤 블록을 읽을지 고르는 선택 단계를 어텐션 질의에 묶어 두었다. SparDA는 층마다 Forecast라는 네 번째 투영을 하나 더 둔다. Forecast가 다음 층이 읽을 블록을 한 층 앞서 예측하고, 그 사이에 CPU에서 GPU로 KV 캐시를 미리 당겨 온다.

희소 어텐션은 어떤 블록을 읽을지 고르는 선택 단계를 어텐션 질의에 묶어 두었다. SparDA는 층마다 Forecast라는 네 번째 투영을 하나 더 둔다. Forecast가 다음 층이 읽을 블록을 한 층 앞서 예측하고, 그 사이에 CPU에서 GPU로 KV 캐시를 미리 당겨 온다.

대런 아세모글루와 두 공저자가 자동화 모형 안에 노동자의 봉기를 집어넣었다. 자동화가 진행될수록 자본가에게는 재분배보다 억압이 싸게 먹히고, 자본이 충분히 쌓이면 경제는 장기적으로 억압으로 수렴한다는 결론이다.

ETH 취리히 연구진이 대학생 100명에게 코드를 감춘 채 자연어로만 앱을 만들게 했다. 컴퓨터과학 성취도와 작문 능력이 모두 성과를 예측했지만, 일반 인지 능력을 통제하자 컴퓨터과학 쪽만 살아남았다.

Google Research가 에이전트 스킬을 자동으로 고쳐 나갈 때, 실행 경험을 영속 위키에 먼저 정리하고 그 위에서 스킬을 손보게 했다. 다섯 모델과 다섯 벤치마크에서 기존 스킬 진화 기법을 모두 앞섰고, 위키를 떼어내면 그 평균이 48.7%에 그친다.

LLM 에이전트의 실행 로그 전체를 상태 7개에서 43개짜리 유한 상태 기계 한 대로 압축하면, 다음 행동 예측과 실패 예측과 런타임 감시가 같은 구조물 위에서 동시에 해결된다. 그리고 그 구조물의 모양은 모델이 아니라 배포 하네스가 정한다.

휴대폰으로 대충 찍은 단안 영상 한 편에서 자유 시점 4D 인간을 복원한다. 시점 수를 수십 개로 늘리면 일관성이 무너지던 원인을 어텐션 컨텍스트 용량 한계로 규명하고, 참조 컨텍스트 압축과 타깃 그룹 회전이라는 두 설계로 푼다.

사진 한 장에서 UE5나 Blender가 그대로 불러올 수 있는 오브젝트와 광원을 뽑아내는 벤치마크 Lumera. 3D 박스 파싱은 기존 방법을 크게 앞섰지만, 개별 광원의 위치 추정은 F1 0.209에 머물러 있다.

기억이 정확하게 저장되고 정확하게 검색되어도 모델의 추론을 망가뜨릴 수 있다. 저장·검색이 아니라 검색된 기억이 현재 과제에 미치는 영향을 재는 벤치마크에서, 다섯 개 메모리 프레임워크가 전부 무기억 기준선보다 낮은 점수를 받았다.

MIT 연구진이 역할도 레시피도 주지 않은 LLM 에이전트 수백 명을 지속적 물리 세계에 풀어놓고, 이들이 남긴 기술을 에이전트가 모두 사라진 뒤에 시험했다. 공유 세계를 가진 사회는 고립 탐색보다 넓고 견고한 기술 포트폴리오를 만들었지만, 최강 단일 발명품은 여전히 고립 탐색의 몫이었다.

자기 개선 에이전트의 평가 기준을 고정하지 않고 에이전트와 함께 진화시키는 탐색 프레임워크. 코딩·논문 쓰기·증명 쓰기 세 영역에서 고정 평가자 기준선을 앞섰고, AI가 쓴 글을 지나치게 잘 받아주던 심사자의 편향까지 탐색 중에 교정했다.