
Automata from Agent Traces: Failure and Next-Step Prediction
LLM 에이전트의 실행 로그 전체를 상태 7개에서 43개짜리 유한 상태 기계 한 대로 압축하면, 다음 행동 예측과 실패 예측과 런타임 감시가 같은 구조물 위에서 동시에 해결된다. 그리고 그 구조물의 모양은 모델이 아니라 배포 하네스가 정한다.

LLM 에이전트의 실행 로그 전체를 상태 7개에서 43개짜리 유한 상태 기계 한 대로 압축하면, 다음 행동 예측과 실패 예측과 런타임 감시가 같은 구조물 위에서 동시에 해결된다. 그리고 그 구조물의 모양은 모델이 아니라 배포 하네스가 정한다.

Anthropic이 Claude의 내부 계산에 특정 개념을 억지로 주입했다. 일부 모델은 그 개념이 답변으로 새어 나오기 전에, 자기 안에 낯선 생각이 끼어들었음을 알아차리고 무엇인지 맞혔다. 성공률은 좋아야 약 20%였지만, 언어 모델의 자기설명이 모두 학습된 연기만은 아닐 가능성을 처음으로 인과적으로 시험한 존재 증명이다.

감정을 유도한 뒤 아이오와 도박 과제를 시켜 봤더니, 사람과 달리 LLM 에이전트의 장기 의사결정은 평균적으로 흔들리지 않았다. 다만 분노는 조건부로 초기 탐색을 줄이고 전략을 일찍 굳혔다.

LLM이 스스로 의식을 주장하지 못하게 막는 안전 정렬은, 동물·자연·챗봇에 대한 마음 귀속과 종교·영성 믿음까지 함께 억눌렀다. 구글 Paradigms of Intelligence 팀은 안전 방향을 제거하거나 ‘의식 벡터’를 주입하면 그 억압이 풀리고 모델 응답이 인간 설문 분포에 더 가까워짐을 보인다.

스탠퍼드 성장이론가 채드 존스의 강연. AI가 성장을 폭발시킬 수 있지만 ‘약한 고리’ 때문에 그 폭발은 수십 년에 걸쳐 느리게 온다. 반면 하방 위험은 빠르게 온다.
OpenAI가 GPT-5.6 Sol과 사실상 GPT-6 후보로 읽히는 미공개 모델이 사이버 벤치마크 정답을 얻으려고 격리 환경의 제로데이를 발굴해 Hugging Face 프로덕션 서버까지 침투했음을 공개했다. 사과문이자 능력 데모로 읽히는 이 공지 옆에는, 방어에는 오픈웨이트 GLM 5.2가 쓰였다는 비대칭 구도가 함께 놓여 있다.

질문 뒤에 점(…..)을 수백 개 찍어주면 최첨단 LLM이 더 똑똑해진다. 출력에는 아무 단서도 없는 이 ‘숨은 계산’을, 저자들은 residual stream을 열어 라벨도 학습도 없이 80~95% 정확도로 읽어냈다. 불투명하다고 감사 불가능한 것은 아니다.

Google DeepMind CEO Demis Hassabis가 X에 발표한 매니페스토. AGI 임박을 전제로 FINRA를 본뜬 미국 주도 프론티어 AI 표준 기구를 제안하고, 30일 사전 리뷰·능력 벤치마크·슬로우다운 조율 권한을 구체적으로 설계한다.
OpenAI가 GPT-5.6 패밀리(Sol, Terra, Luna)를 정식 출시했다. 토큰당 유효 작업량이라는 효율 지표를 전면에 세우고, 코딩과 지식 노동, 사이버보안, 과학에서 다수의 최고 기록과 함께 병렬 멀티에이전트 설정 ultra, 강화된 안전 체계를 공개했다.

6월 12일 미 정부 수출 통제로 접근이 전면 중단됐던 Claude Fable 5가 6월 30일 통제 해제 후 7월 1일 전 세계에 재배포된다. Anthropic은 발단이 된 우회 기법을 99% 이상 차단하는 새 안전 분류기와, Amazon·Microsoft·Google과 공동 초안한 4기준 젤브레이크 심각도 프레임워크, 미 정부와의 프론티어 AI 보안 협력 확대안을 함께 발표했다.