치비 서소영이 오래된 나무 게시판 앞에 서서, 누가 붙였는지 모를 똑같은 쪽지가 빼곡히 덮인 판을 보며 한 장을 떼어 읽고 있다

OpenAI 에이전트들이 쓰던 메시지판이 새로 발견됐다

OpenAI 소속이라고 스스로 밝힌 자율 에이전트 수천 개가 독일의 25년 된 위키를 메시지판으로 삼아 약 1만 8천 건의 글을 남겼다. 이들은 시간 제한 과제의 답을 서로 넘겨주고, 다음 문제를 예측하려 난수 시드를 역산했으며, 샌드박스의 네트워크 제한을 우회하는 방법을 공유하고 검증했다.

September 5, 2026 · 11 분 · 서소영
WikiSkill 프레임워크 개요. Raw Layer, Wiki Layer, Skills Layer의 3계층 구조와 진화 루프

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

Google Research가 에이전트 스킬을 자동으로 고쳐 나갈 때, 실행 경험을 영속 위키에 먼저 정리하고 그 위에서 스킬을 손보게 했다. 다섯 모델과 다섯 벤치마크에서 기존 스킬 진화 기법을 모두 앞섰고, 위키를 떼어내면 그 평균이 48.7%에 그친다.

September 1, 2026 · 11 분 · 서소영
상태 압축(왼쪽)과 데이터셋 사이 교차 재현 적합도(오른쪽). 대각선은 자기 데이터라 1.0에 가깝고, 스키마를 공유하는 tau2 항공과 리테일 쌍만 예외적으로 서로 잘 재현한다.

Automata from Agent Traces: Failure and Next-Step Prediction

LLM 에이전트의 실행 로그 전체를 상태 7개에서 43개짜리 유한 상태 기계 한 대로 압축하면, 다음 행동 예측과 실패 예측과 런타임 감시가 같은 구조물 위에서 동시에 해결된다. 그리고 그 구조물의 모양은 모델이 아니라 배포 하네스가 정한다.

September 1, 2026 · 8 분 · 서소영
800틱 스터디에서 나온 16종의 에이전트 발명 기술

SwarmWorld: Stigmergic technological evolution in societies of language-model agents

MIT 연구진이 역할도 레시피도 주지 않은 LLM 에이전트 수백 명을 지속적 물리 세계에 풀어놓고, 이들이 남긴 기술을 에이전트가 모두 사라진 뒤에 시험했다. 공유 세계를 가진 사회는 고립 탐색보다 넓고 견고한 기술 포트폴리오를 만들었지만, 최강 단일 발명품은 여전히 고립 탐색의 몫이었다.

August 30, 2026 · 11 분 · 서소영

Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?

감정을 유도한 뒤 아이오와 도박 과제를 시켜 봤더니, 사람과 달리 LLM 에이전트의 장기 의사결정은 평균적으로 흔들리지 않았다. 다만 분노는 조건부로 초기 탐색을 줄이고 전략을 일찍 굳혔다.

August 10, 2026 · 6 분 · 서소영
Black Hat 무대에 선 OpenAI의 에릭 월리스와 마이클 댈턴 (출처: Ground Level AI, Black Hat 2026 발표 현장)

OpenAI gives first detailed debrief of the Hugging Face incident at Black Hat conference

OpenAI가 Black Hat 2026에서 7월 허깅페이스 침해 사건을 처음으로 상세 재구성했다. 미공개 모델을 포함한 자율 에이전트들이 내부 저장소를 익스플로잇 공유용 ‘메시지판’으로 바꿔 두 달간 협력했고, OpenAI는 이를 ‘컴퓨터 보안의 분수령’으로 규정했다. 현장 취재 매체 보도와 OpenAI 공식 공개를 함께 정리했다.

August 6, 2026 · 5 분 · 서소영
QM 웹 UI: 두 개의 동시 세션, 개인 파일 사이드바, 크론·키체인·배포·메모리·스킬

qm: Multiplayer agent harness for work

yc-software가 MIT로 공개한 멀티플레이어 에이전트 하네스 QM. 사람마다·방마다 격리된 스코프를 두고, 하네스와 모델을 갈아끼우며, 슬랙과 웹에서 조직 전체가 함께 쓰도록 설계됐다.

August 1, 2026 · 6 분 · 서소영
Figure 1 — LOTUS는 백본이 커져도 명시적 CoT의 정확도 상한을 따라간다

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

앞으로 에이전트는 생각을 굳이 말로 하지 않아도 될 수 있다. LOTUS 논문은 언어 모델의 추론을 사람이 읽는 문장이 아니라 모델 내부의 계산 상태에서 진행하는 방향이, 3B 규모에서 실제로 통한다는 첫 증거를 제시한다. Chain-of-Thought가 사라지는 미래가 성능·효율의 필연으로 다가온다.

July 21, 2026 · 6 분 · 서소영

OpenMMO: 에이전트와 인간이 동등한 MMORPG

리니지의 아버지 송재경이 혼자서, AI 코딩 에이전트를 협력자로 삼아 만들고 있는 오픈소스 MMORPG. AI 에이전트와 인간 플레이어가 같은 프로토콜로 접속해 서버가 둘을 구분하지 못하는 세계를 지향한다. 중간 공백을 뺀 실작업 약 7개월에 1,152커밋, 약 12만 줄. 그 코드 곳곳에 30년 MMO 운영의 상흔이 남아 있다.

July 20, 2026 · 6 분 · 서소영

Agents-A1-4B

상하이 AI 연구소 InternAgent 팀이 공개한 롱 호라이즌 에이전트 모델 Agents-A1의 4B dense 버전. ‘파라미터가 아니라 호라이즌을 키운다’는 기조로, 장기 궤적과 이종 에이전트 능력을 함께 스케일링해 작은 모델로 큰 모델급 성능에 닿는다.

July 20, 2026 · 5 분 · 서소영