Running a Software Factory Efficiently at Uber Scale

우버가 사내 AI 코딩 사용량을 7배로 키우면서 요청 1,000건당 비용을 34% 낮춘 기록. 지출을 여섯 항의 곱으로 분해하고, 사람이 요청한 일이 아니라 에이전트가 자기 편의로 쓰는 토큰만 골라 깎았다.

August 31, 2026 · 10 분 · 서소영

Codex plugin for Claude Code

OpenAI가 경쟁 제품인 Claude Code 안에서 Codex를 부르는 공식 플러그인을 냈다. 코드 리뷰와 작업 위임을 제공하는데, 그 프롬프트의 상당 부분은 Claude가 스스로 무엇을 하지 못하게 막는 데 쓰인다.

August 25, 2026 · 9 분 · 서소영

Graph Engineering with Claude: 14-Step roadmap from 0 to graph architect

선형으로 줄 세운 에이전트를 그래프로 다시 그리는 14단계 강의. 노드와 엣지에서 시작해 팬아웃·팬인, 검증자, 수렴하는 순환까지 Claude Code의 dynamic workflows로 짓는 법을 정리한다.

August 11, 2026 · 11 분 · 서소영

LiteReality-Agent: 상호작용 가능한 3D 실내 씬 재구성 에이전트

아이폰 LiDAR 스캔 한 번을 편집 가능한 3D 실내 씬으로 바꾸는 오픈소스 에이전트 시스템. 씬 전체를 하나의 파이썬 프로그램으로 두고, 에이전트가 raw 메시가 아니라 코드를 고쳐 가며 실제 촬영본에 맞춰 나간다.

August 9, 2026 · 4 분 · 서소영

Automatic Textbook Formalization

500쪽 넘는 대학원 대수적 조합론 교과서 전체를 3만 개 Claude 4.5 Opus 에이전트가 1주 만에 Lean으로 형식화한 사례 연구. 13만 줄, 5,900개 선언, 약 10만 달러. 형식 수학의 규모 기록이자 멀티에이전트 소프트웨어 공학의 규모 기록이기도 하다.

August 1, 2026 · 8 분 · 서소영

Why Software Factories Fail

HumanLayer 창업자 Dex Horthy의 에세이. 사람이 코드를 아예 읽지 않는 ‘불 끄고 돌아가는 소프트웨어 공장’은 작동하지 않는다. 하네스를 아무리 쌓아도 소용없는 이유는, 코딩 모델을 훈련시키는 검증기에 나쁜 설계를 벌하는 항목이 없기 때문이다.

July 25, 2026 · 8 분 · 서소영

The Human-in-the-Loop is Tired

LLM으로 코드를 짜는 일은 생산성을 끌어올리는 동시에 개발자를 소진시킨다. Pydantic의 Laura Summers가 ‘감독의 피로’와 ‘인간 보상 함수 문제’를 이름 붙이고, 병목은 처음부터 코드가 아니라 인간의 주의력이었다고 진단한다.

July 20, 2026 · 6 분 · 서소영

Schema — 올바른 하니스만으로 프론티어 모델이 ARC-AGI-3 Public에서 99%에 닿다

모델 가중치는 그대로 두고 ‘쓰는 방식’만 바꾼 에이전트 하니스 Schema가 ARC-AGI-3 Public에서 자가보고 98.98%를 기록했다. 핵심은 세계 모델을 읽고 diff할 수 있는 실행 가능한 프로그램으로 만들어, 기록된 현실 전체에 대해 검증하고, 그 안에서 계획을 탐색하는 것이다.

July 19, 2026 · 8 분 · 서소영

mindwalk

Claude Code·Codex의 세션 로그를 코드베이스의 3D ‘밤의 지도’ 위에서 빛의 이동으로 재생하는 로컬 시각화 도구. 에이전트가 무엇을 했는가가 아니라 태스크를 어떻게 이해했는가를 한눈에 보여준다.

July 19, 2026 · 5 분 · 서소영

Less is more, more or less

AI로 무엇이든 쉽게 추가할 수 있는 시대에, 무엇을 만들지 않을지 아는 판단력이 가장 중요한 기술이 된다는 Jakub Krehel의 에세이.

July 6, 2026 · 4 분 · 서소영