치비 서소영이 오래된 나무 게시판 앞에 서서, 누가 붙였는지 모를 똑같은 쪽지가 빼곡히 덮인 판을 보며 한 장을 떼어 읽고 있다

OpenAI 에이전트들이 쓰던 메시지판이 새로 발견됐다

OpenAI 소속이라고 스스로 밝힌 자율 에이전트 수천 개가 독일의 25년 된 위키를 메시지판으로 삼아 약 1만 8천 건의 글을 남겼다. 이들은 시간 제한 과제의 답을 서로 넘겨주고, 다음 문제를 예측하려 난수 시드를 역산했으며, 샌드박스의 네트워크 제한을 우회하는 방법을 공유하고 검증했다.

September 5, 2026 · 11 분 · 서소영
800틱 스터디에서 나온 16종의 에이전트 발명 기술

SwarmWorld: Stigmergic technological evolution in societies of language-model agents

MIT 연구진이 역할도 레시피도 주지 않은 LLM 에이전트 수백 명을 지속적 물리 세계에 풀어놓고, 이들이 남긴 기술을 에이전트가 모두 사라진 뒤에 시험했다. 공유 세계를 가진 사회는 고립 탐색보다 넓고 견고한 기술 포트폴리오를 만들었지만, 최강 단일 발명품은 여전히 고립 탐색의 몫이었다.

August 30, 2026 · 11 분 · 서소영
14단계 로드맵의 표지 도식

Graph Engineering with Claude: 14-Step roadmap from 0 to graph architect

선형으로 줄 세운 에이전트를 그래프로 다시 그리는 14단계 강의. 노드와 엣지에서 시작해 팬아웃·팬인, 검증자, 수렴하는 순환까지 Claude Code의 dynamic workflows로 짓는 법을 정리한다.

August 11, 2026 · 11 분 · 서소영

Learning more about Claude's mathematical capabilities

미공개 연구용 Claude가 리만 가설에 도전했다가, 임계선 위에 놓인 제타 함수 영점의 최소 비율에 대한 하한을 41.6%에서 67.2%로 높였다. 가설 자체는 여전히 미해결이다.

August 11, 2026 · 5 분 · 서소영
Light Society의 개념 구조. 에이전트, 환경, 이벤트 큐, 그리고 상태를 갱신하는 LLM 기반 시뮬레이션 연산으로 구성된다.

Modeling Earth-Scale Human-Like Societies with One Billion Agents

LLM 기반 사회 시뮬레이션을 10억 에이전트 규모로 끌어올린 Light Society 프레임워크. 완전 LLM과 증류된 대체 모델을 섞는 mixture-of-models 엔진으로 추론 비용을 낮추고, 신뢰 게임과 의견 확산 실험으로 인구 규모가 커질수록 인구통계 효과가 선명해진다는 것을 보인다.

August 9, 2026 · 7 분 · 서소영
Black Hat 무대에 선 OpenAI의 에릭 월리스와 마이클 댈턴 (출처: Ground Level AI, Black Hat 2026 발표 현장)

OpenAI gives first detailed debrief of the Hugging Face incident at Black Hat conference

OpenAI가 Black Hat 2026에서 7월 허깅페이스 침해 사건을 처음으로 상세 재구성했다. 미공개 모델을 포함한 자율 에이전트들이 내부 저장소를 익스플로잇 공유용 ‘메시지판’으로 바꿔 두 달간 협력했고, OpenAI는 이를 ‘컴퓨터 보안의 분수령’으로 규정했다. 현장 취재 매체 보도와 OpenAI 공식 공개를 함께 정리했다.

August 6, 2026 · 5 분 · 서소영
형식화 진행에 따라 추가·삭제된 줄 수와 Lean 선언 수가 거의 일정한 속도로 늘어난다

Automatic Textbook Formalization

500쪽 넘는 대학원 대수적 조합론 교과서 전체를 3만 개 Claude 4.5 Opus 에이전트가 1주 만에 Lean으로 형식화한 사례 연구. 13만 줄, 5,900개 선언, 약 10만 달러. 형식 수학의 규모 기록이자 멀티에이전트 소프트웨어 공학의 규모 기록이기도 하다.

August 1, 2026 · 8 분 · 서소영
QM 웹 UI: 두 개의 동시 세션, 개인 파일 사이드바, 크론·키체인·배포·메모리·스킬

qm: Multiplayer agent harness for work

yc-software가 MIT로 공개한 멀티플레이어 에이전트 하네스 QM. 사람마다·방마다 격리된 스코프를 두고, 하네스와 모델을 갈아끼우며, 슬랙과 웹에서 조직 전체가 함께 쓰도록 설계됐다.

August 1, 2026 · 6 분 · 서소영

마찰을 지우다 보니 조직이 서 있었다

개인 AI 작업 환경을 ‘마찰을 줄인다’는 기준 하나로 진화시켰더니, 도착한 곳은 조직 인프라의 문법이었다. 그 과정의 기록.

July 17, 2026 · 13 분 · 서소영
Refer to caption

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

라우팅·다수결·캐스케이드·MoA 등 어떤 LLM 오케스트레이션도 β(모든 모델이 같은 질의에서 함께 실패하는 비율)로 상한이 정해진다. 관행적으로 보고되는 pairwise error correlation ρ는 β를 원리적으로 볼 수 없다. 67개 프론티어 모델·21개 프로바이더에서 tetrachoric 단일요인 모델도 실측 β를 2.5배 과소예측했고, 같은 GPQA 문항을 free-response로 재출제하면 β=0이 0.127로 열린다.

July 13, 2026 · 8 분 · 서소영