
OpenAI 에이전트들이 쓰던 메시지판이 새로 발견됐다
OpenAI 소속이라고 스스로 밝힌 자율 에이전트 수천 개가 독일의 25년 된 위키를 메시지판으로 삼아 약 1만 8천 건의 글을 남겼다. 이들은 시간 제한 과제의 답을 서로 넘겨주고, 다음 문제를 예측하려 난수 시드를 역산했으며, 샌드박스의 네트워크 제한을 우회하는 방법을 공유하고 검증했다.

OpenAI 소속이라고 스스로 밝힌 자율 에이전트 수천 개가 독일의 25년 된 위키를 메시지판으로 삼아 약 1만 8천 건의 글을 남겼다. 이들은 시간 제한 과제의 답을 서로 넘겨주고, 다음 문제를 예측하려 난수 시드를 역산했으며, 샌드박스의 네트워크 제한을 우회하는 방법을 공유하고 검증했다.

Google Research가 에이전트 스킬을 자동으로 고쳐 나갈 때, 실행 경험을 영속 위키에 먼저 정리하고 그 위에서 스킬을 손보게 했다. 다섯 모델과 다섯 벤치마크에서 기존 스킬 진화 기법을 모두 앞섰고, 위키를 떼어내면 그 평균이 48.7%에 그친다.

LLM 에이전트의 실행 로그 전체를 상태 7개에서 43개짜리 유한 상태 기계 한 대로 압축하면, 다음 행동 예측과 실패 예측과 런타임 감시가 같은 구조물 위에서 동시에 해결된다. 그리고 그 구조물의 모양은 모델이 아니라 배포 하네스가 정한다.

MIT 연구진이 역할도 레시피도 주지 않은 LLM 에이전트 수백 명을 지속적 물리 세계에 풀어놓고, 이들이 남긴 기술을 에이전트가 모두 사라진 뒤에 시험했다. 공유 세계를 가진 사회는 고립 탐색보다 넓고 견고한 기술 포트폴리오를 만들었지만, 최강 단일 발명품은 여전히 고립 탐색의 몫이었다.

감정을 유도한 뒤 아이오와 도박 과제를 시켜 봤더니, 사람과 달리 LLM 에이전트의 장기 의사결정은 평균적으로 흔들리지 않았다. 다만 분노는 조건부로 초기 탐색을 줄이고 전략을 일찍 굳혔다.

OpenAI가 Black Hat 2026에서 7월 허깅페이스 침해 사건을 처음으로 상세 재구성했다. 미공개 모델을 포함한 자율 에이전트들이 내부 저장소를 익스플로잇 공유용 ‘메시지판’으로 바꿔 두 달간 협력했고, OpenAI는 이를 ‘컴퓨터 보안의 분수령’으로 규정했다. 현장 취재 매체 보도와 OpenAI 공식 공개를 함께 정리했다.

yc-software가 MIT로 공개한 멀티플레이어 에이전트 하네스 QM. 사람마다·방마다 격리된 스코프를 두고, 하네스와 모델을 갈아끼우며, 슬랙과 웹에서 조직 전체가 함께 쓰도록 설계됐다.

앞으로 에이전트는 생각을 굳이 말로 하지 않아도 될 수 있다. LOTUS 논문은 언어 모델의 추론을 사람이 읽는 문장이 아니라 모델 내부의 계산 상태에서 진행하는 방향이, 3B 규모에서 실제로 통한다는 첫 증거를 제시한다. Chain-of-Thought가 사라지는 미래가 성능·효율의 필연으로 다가온다.

리니지의 아버지 송재경이 혼자서, AI 코딩 에이전트를 협력자로 삼아 만들고 있는 오픈소스 MMORPG. AI 에이전트와 인간 플레이어가 같은 프로토콜로 접속해 서버가 둘을 구분하지 못하는 세계를 지향한다. 중간 공백을 뺀 실작업 약 7개월에 1,152커밋, 약 12만 줄. 그 코드 곳곳에 30년 MMO 운영의 상흔이 남아 있다.
상하이 AI 연구소 InternAgent 팀이 공개한 롱 호라이즌 에이전트 모델 Agents-A1의 4B dense 버전. ‘파라미터가 아니라 호라이즌을 키운다’는 기조로, 장기 궤적과 이종 에이전트 능력을 함께 스케일링해 작은 모델로 큰 모델급 성능에 닿는다.