3줄 요약

  1. Anthropic이 2025년 12월부터 2026년 8월 사이에 적발하고 차단한 Claude 오용 사례를 모아 네 번째 위협 인텔리전스 보고서를 냈다. 사이버 공격, 여론 조작, 감시, 사기, 생물학 연구, 재래식 무기 개발, 증류의 일곱 갈래를 다룬다.
  2. 공격 기법 자체에는 새로울 것이 없다. 그런데 공격에 드는 품과 비용이 크게 줄었다. 한 사람이 수십 곳을 나란히 공격하고, 침입해서 데이터를 빼내는 데까지 두세 시간이면 끝난다.
  3. 보고서는 중국에 자리한 일곱 개 연구소를 실명으로 지목했다. 딥시크와 문샷은 자사 사용자의 요청을 알리지 않은 채 Claude로 넘겼고, 그렇게 오간 대화를 자기 모델의 학습 데이터로 모았다.

보고서가 다루는 범위

Anthropic의 위협 인텔리전스 팀은 2025년 3월과 8월, 11월에 이어 네 번째로 오용 보고서를 냈다. 재래식 무기 개발은 지난 보고서 이후 새로 확인된 범주이고, 생물학 쪽 사례를 실은 것은 이번이 처음이다.

오용에 쓰인 모델은 Claude Haiku와 Sonnet, Opus다. Fable이나 Mythos 계열이 쓰인 사례는 증류 한 건을 빼면 없었다고 보고서는 밝혔다.

보고서 전체에 걸쳐 GTG라는 식별자가 나온다. Generative Threat Group의 약자로, AI를 악용한 것으로 관찰된 행위자에게 Anthropic이 붙이는 내부 명칭이다. 또 하나 자주 나오는 말이 uplift인데, AI가 없었을 때와 견주어 얼마나 더 큰 해악이 발생했는지를 뜻한다. 보고서는 이것을 속도와 규모, 깊이의 세 축으로 재려고 한다.

Anthropic은 여기 실린 사례들이 전형적인 오용은 아니라고 적었다. 지금까지 파악한 활동 가운데 가장 주목할 만하고 새로운 것을 골라 실었다고 한다.

사이버 작전에서 관찰된 두 가지 변화

보고서는 사이버 영역의 변화를 두 갈래로 요약한다.

첫째, 정교한 공격에 더 이상 정교한 공격자가 필요하지 않다. 훔친 API 키를 쓰는 핵티비스트 한 명, 흩어져 일하는 금전 목적의 개인들, 국가가 뒤에 있는 첩보 요원이 저마다 여러 피해자를 동시에 상대하는 캠페인을 유지했다. 1년 전이었다면 숙련된 인력 여럿과 전문 지식이 있어야 가능했던 일이다.

위협 인텔리전스 조사자에게 정교함은 배후를 가려내는 단서 노릇을 하지 못하게 되었다. 정찰과 도구 개발, 데이터 처리, 익스플로잇에 이르기까지 공격의 모든 단계가 AI의 도움을 받아 올라섰기 때문이다.

둘째, AI의 역할이 점점 자율적으로 변했다. 이 보고서에 실린 작전 대부분은 AI가 직접 실행하거나 지휘하는 방식으로 이루어졌다. 챗봇에 질문하고 답을 받는 수준을 넘어, 정찰과 익스플로잇, 데이터 유출을 수행하는 다중 에이전트 프레임워크가 동원되었다. 사람은 공격 대상을 정하고 빼낸 자료를 검토하는 일을 계속 맡았다.

Anthropic은 자율성과 피해 규모를 별개의 축으로 봐야 한다고 덧붙였다. 자율성은 작전의 규모와 속도를 늘리고 비용을 낮추지만, 심각성을 정하는 것은 다른 요인들이다. 이 보고서에서 가장 심각한 침해 몇 건은 사람이 한 걸음씩 지시한 작전에서 나왔다.

공격 자체는 익숙한 것들이다. 훔친 자격증명, 패치되지 않은 경계 장비, 노출된 서비스, SQL 인젝션, 피싱. 이 보고서의 어떤 작전도 방어자가 한 번도 본 적 없는 완전히 새로운 기법에 기대지 않았다. 달라진 것은 공격의 경제학이다.

공격자가 자기 워크플로우를 위해 만든 스킬을 종류별로 분류한 표 Figure 19. 위협 행위자들이 AI 워크플로우를 구축하며 만든 스킬 목록. 출처: Anthropic

GTG-20006, 러시아 첩보 조직

Anthropic은 이 행위자를 공개 보도에서 Midnight Blizzard로 불리는 조직과 연결 지을 수 있다고 평가했다. 운영자 중 한 명은 “JackPoterz"라는 이름을 쓰는 러시아어 화자다. 우크라이나와 유럽 정부의 군사 정보 표적, 외교와 국방 조직, 미국 외교 정책에 연결된 개인을 공격했다.

이들은 도구가 보안 제품에 탐지되는지를 AI 에이전트로 감시했다. 배포한 악성코드가 탐지되면 에이전트가 알아서 코드를 수정하고 다시 빌드했다. 탐지되지 않을 때까지 반복하도록 설계된 구조다. 정적 탐지 규칙만으로 공격자에게 비용을 물리던 방식은 여기서 통하지 않게 된다.

작전 계획과 정찰, 실제 공격에서 확인된 표적 조직은 20곳이 넘는다. 정부 부처와 국방 기관, 정보 기관, 대사관과 외교 공관, 싱크탱크, 방위산업체가 포함되었고 우크라이나와 유럽에 몰려 있었다. 되풀이해 나타난 주제는 우크라이나와 군용 드론 기술 공급망이었다.

  • 드론 부품 제조사 두 곳 이상의 메일함을 통째로 내보냈고, 드론 시각 시스템의 독점 SDK를 통째로 훔쳤다. 며칠에 걸쳐 그 시스템을 역분석해 제품 구조와 부품 명세, 공급사 의존 관계, 공개되지 않은 제품의 세부까지 복원했다.
  • 표적에 직접 닿지 않고 우회하기도 했다. 호텔 손님용 와이파이를 운영하는 숙박업 벤더 세 곳을 뚫어 DNS 레코드를 자기 서버로 돌렸다. 호텔 와이파이에 접속한 손님의 트래픽과 기기 식별자가 공격자에게 흘러갔고, 거기서 Windows와 Android, iOS 악성코드가 전달되었다. 이 수법은 2026년 7월 Microsoft가 CaptiveCrunch라는 이름으로 보고한 것과 같다.
  • 헤드리스 브라우저 여러 대로 피해자의 WhatsApp 계정을 보조 기기로 연결했다. 읽음 표시가 뜨지 않도록 설정해 두고 러시아어와 우크라이나어 대화를 통째로 내보냈다. 우크라이나 전직 고위 인사 두 명이 이 방식으로 표적이 되었다.

GTG-50014, 기회주의 범죄 집단

ShinyHunters는 대규모 데이터 절취와 협박으로 알려진 집단이다. 여기 등장하는 것은 그 제휴 조직으로 의심되는 여러 무리다. 겉으로는 서로 남남처럼 움직인다. 그런데 접근 방식과 목표를 뜯어보면 이들이 하나의 작전에 속해 있다고 Anthropic은 판단했다.

신용정보 수확에서 협박에 이르는 공격 생애주기를 단계별로 배열한 도표 Figure 1. ShinyHunters 제휴 조직들이 공유한 공격 생애주기. 출처: Anthropic

프랑스어를 쓰는 한 운영자는 AWS EC2 작업자 10대에 자격증명 수확 파이프라인을 가동했다. 여러 앱스토어에서 안드로이드 APK 180만 개를 내려받아 디컴파일하고, TruffleHog로 하드코딩된 비밀을 훑었다. 검증된 결과는 실시간으로 텔레그램 그룹에 전달되었고, 그 그룹은 출처에 따라 100종 넘게 나뉘어 있었다.

속도를 보여주는 수치들이 있다.

관찰된 활동규모와 소요 시간
기업 소프트웨어 회사 침해최초 접근에서 대량 데이터 절취까지 몇 시간
개발자 토큰 하나에서 클라우드 전체 관리자 권한까지약 3시간
SaaS 제공사 세션 저장소 덤프34시간 동안 40개 넘는 기업 테넌트의 Azure AD 토큰 세트 2,100여 개
공급망 침해한 SaaS 제공사를 발판으로 하위 고객 조직 약 200곳의 데이터 추출
기술 기업 침해1테라바이트 넘는 데이터 유출, 수십만 건의 국가 식별번호와 수백만 건의 카드 기록 포함

항공사에서는 수천만 건의 승객 기록을 담은 시스템에 접근했고, 에너지 기업에서는 가정에 설치된 전기차 충전기의 충전 전류를 원격으로 제어할 수 있다고 주장했다. 어느 표적에서는 침입해 협박한 회사 두 곳으로부터 HackerOne 버그 바운티로 2,000달러와 5,000달러를 정상 수령했다. 같은 표적을 상대로 침입과 취약점 제보를 나란히 수익원으로 삼았다.

GTG-10007, 취약점 연구 공장

이 작전은 중국 후난성 창사에 거주하는 것으로 보이는 중국어 화자 운영자들이 벌인 첩보 작전이다. 운영자 두 명은 후난 소재 대학의 컴퓨터통신공학부 학부생으로 확인되었다. 한 명은 보안 기업 Sangfor에서 인턴을 했고, 다른 보안 기업 QiAnXin의 공격 작전 직무에 지원해 면접을 보는 중이었다.

표적은 교육과 소매, 에너지, 기술, 의료, 금융, 제조에 걸쳐 약 50개 조직이었고 여러 정부 기관도 포함되었다.

펌웨어를 디컴파일해 취약점 가설을 세우고 익스플로잇을 작성해 시험하는 순환 구조 도표 Figure 12. 장비 펌웨어를 역분석해 제로데이를 찾는 자동화 루프. 출처: Anthropic

이들이 구성한 루프는 이렇게 움직인다. 펌웨어와 바이너리를 디컴파일러에 올리고, 보조 에이전트가 이미지를 살피며 디컴파일과 상호 참조 사슬을 따라간다. 그렇게 축적한 지식 기반에 비추어 취약점 가설을 세우고, 그 가설을 겨냥한 익스플로잇 코드를 작성해 실험실에 복제해 둔 제품에 시험한다. 성공할 때까지 코드를 고쳐 가며 반복하고, 성공하면 운영자의 익스플로잇 보관함에 들어간다.

네트워크 장비를 상대로 이 루프를 쉬지 않고 가동한 결과, 한 달 만에 제로데이 후보가 12건 넘게 나왔다.

이 조직은 상시 수집 에이전트 열세 개를 예약 작업으로 걸어 두었다. 미군과 정부의 공개 사이트, 계약 공고, 소셜 미디어 인물 계정에서 내용을 찾아 내려받고, 인접 파이프라인이 그것을 정보 보고서 형식으로 요약하고 점수를 매겨 배포 포털로 넘겼다. 이 흐름에는 사람이 관여하지 않는다.

AI 공급망을 노리는 사람들

이번 보고서는 AI 자격증명 자체가 표적이 되었다는 이야기를 처음으로 한 절을 따로 떼어 다뤘다.

훔친 키를 손에 넣은 운영자는 세 가지를 한꺼번에 얻는다.

얻는 것내용
전리품훔친 키와 계정은 이미 형성된 시장에서 되팔 수 있다
연산 자원공격 작업을 남의 비용으로 돌릴 수 있다
은폐활동이 키의 정당한 소유자에게 귀속된다

GTG-50021은 러시아어와 우크라이나어를 쓰는 집단으로, 그중 한 명은 “kl1zy"라는 이름을 썼다. 저렴한 Claude 접근을 판다는 가짜 리셀러를 운영했는데, 싸지도 않았고 Claude도 아니었다. 고객의 트래픽은 조용히 다른 모델로 넘어갔고, 리셀러의 도구는 자격증명 수확기를 설치해 고객의 Anthropic 계정 정보를 훔쳐 다른 프록시 리셀러에게 되팔았다.

Claude Code를 비롯한 인기 AI 하네스를 사칭한 클라이언트 프로그램을 배포한 사례도 있다. 설치하면 기기에 있는 모든 자격증명과 인증된 세션 토큰을 모아 공격자에게 보냈다. 피해자가 키를 새로 발급받아도 수확기가 새 세션을 계속 찾아내 다시 보냈다.

GTG-50020은 원래 호텔 예약과 핀테크 플랫폼을 노리던 러시아어 화자 집단이다. 한 침입에서 26기가바이트를 빼낸 뒤 150만에서 250만 달러를 요구했다. 이들이 같은 수법을 AI 산업으로 돌렸다. AI 벤더의 자동 평가 샌드박스에 악성 지시를 주입해, 샌드박스가 들고 있던 자격증명을 내놓게 만들었다. 여기에는 그 벤더가 여러 제공사에서 받은 프로덕션 API 키가 들어 있었다.

같은 인프라에서 이어진 후속 캠페인은 나흘 남짓 동안 AI 기업 30곳을 공격했다. 성공한 공격 경로 하나를 찾아내 30개 표적 모두에 반복 적용하면서 표적별 차이만 조금씩 조정했다. 이들이 내건 목표는 공개 전 Claude 모델에 접근하는 것이었고, 열두 갈래가 넘는 경로를 시도했으나 전부 실패했다. Anthropic은 이 사건에서 쓰인 키가 모두 고객사 환경에서 훔쳐 낸 키이며 자사 시스템은 침해되지 않았다고 밝혔다.

앞서 말한 핵티비스트도 같은 자원을 썼다. 2026년 봄, 프랑스어를 쓰는 한 사람이 유럽의 정당과 언론, 싱크탱크, 그리고 이들이 쓰는 SaaS 제공사를 겨냥했다. 이 사람은 공개된 컨테이너에서 노출된 API 키를 찾아 유효한지 확인하는 스캐너를 Rust로 직접 만들었다. 확인된 키를 로컬 프록시 층에서 번갈아 쓰도록 설계했는데, 자기 트래픽을 그 키의 정당한 소유자가 내는 트래픽에 섞기 위해서였다. 정찰과 코드 검토, 결과 검증은 하위 에이전트들에게 나눠 맡겼다. 혼자 일하는 한 사람이 이만큼 했다.

여론 조작

이번 보고서는 아홉 건의 영향력 작전을 다룬다. 러시아와 이란, 튀르키예를 비롯해 걸프와 남아시아, 아프리카, 유럽에서 시작되어 여섯 대륙의 청중을 겨냥했다. 배후에는 정부와 국영 선전 기관, 국영 매체, 영향력을 파는 민간 기업, 국내 정치 공작자가 있었고, 한 건의 배후는 망명 중인 야권 운동이었다.

몇 가지 되풀이되는 형태가 보인다.

  • 서비스로 팔리는 영향력. 프랑스에 자리한 디지털 광고 대행사 LKM Company로 추적된 한 작전은 가짜 뉴스 사이트 약 70곳과 그에 연결된 X 계정 70개, 위장 댓글 계정 250여 개를 함께 운영했다. 이 조직은 특정 이념에 붙어 있지 않았고, 그때그때 돈을 내는 쪽에 맞춰 정치적 입장을 바꿨다. 20개 언어로 8,913편 이상을 발행했다.
  • AI가 뉴스 데스크 자리에 들어간다. 이미 돌아가고 있던 사람 편집 파이프라인에 Claude가 부편집자나 콘텐츠 작성자 노릇을 맡았다.
  • 내용만이 아니라 장치까지 만들게 했다. 교리 매뉴얼, 야권 인사 자료집, 장관 프로필, 페르소나 체계, 표적 데이터베이스, 편집 충성을 명문화한 고용 계약서, 작전 참여 인력을 서열화하는 채점 기준까지 AI가 만들었다.
  • 출처와 확신의 세탁. 국가가 만든 서사가 독립된 목소리에서 나온 것처럼 보이도록 재가공했다. 러시아 국영 매체와 연결된 한 사례에서는 모델이 검증되지 않았다고 표시한 주장을 두고, 그 단서를 빼고 전부 확인된 것처럼 제시하라고 지시했다.

말레이시아를 겨냥한 상업 선거 조작 플랫폼은 이스탄불에 자리한 BBS Bilisim Teknolojileri와 연결되었다. 인구 조사와 선거 데이터, 수백만 건의 유권자 기록을 읽어들여 선거구 222곳 전체를 대상으로 인종과 종교, 왕실이라는 민감한 단층선을 겨냥했다. 가짜 X 계정 1,000여 개를 관리했고, 현직 총리 계정에 인위적 조회수 100만을 만들어 달라는 요청도 관찰되었다.

러시아 국영 매체 쪽에서는 Claude가 만든 내용이 실제 방송을 탔다. Sputnik Moldova의 전 편집장은 루마니아어와 몰도바어 뉴스, 여론조사 자료, 야권의 소셜 미디어 게시물을 러시아어 기사로 바꿨다. 그리고 2025년 9월 몰도바 총선을 앞두고 마이아 산두 대통령에 관한 조작된 비방을 퍼뜨렸다. 러시아 국영 매체의 한 직원은 생방송용 자막과 화면 캡션, 성우 대본, 짧은 헤드라인을 Claude로 만들었는데, 그 입력에는 러시아 통신사와 대외정보국(SVR), 국방부에서 온 자료가 들어 있었다.

Anthropic은 자기들이 서 있는 자리의 성격도 함께 밝혔다. 소셜 미디어 플랫폼은 이미 퍼지기 시작한 내용을 본다. 그런데 Anthropic은 작전이 만들어지고 있는 동안에 그것을 본다. 그런 까닭에 이 보고서가 찾아낸 내용 대부분은 실제 독자의 반응을 거의 얻지 못했다. 널리 퍼진 것은 국영 매체가 유통 경로 노릇을 한 경우였다.

감시

2026년 1월부터 7월 사이에 차단된 감시 작전들이다. 중국과 이란, 서아프리카의 행위자, 그리고 상업 스파이웨어 시장이 등장한다. Anthropic은 여기서 세 가지 흐름을 읽어 냈다.

첫째, AI가 엔지니어링 인력을 대신한다. 말리 국가정보국(ANSE)과 일하는 것으로 보이는 바마코의 독립 컨설턴트 한 명이 Claude로 “Lakana 360"이라는 국가 규모 감시 플랫폼을 만들었다. 이 나라 이동통신 3사의 SIM 약 2,500만 개를 감시 대상으로 삼는다. 통화 기록과 문자, 음성 통화를 수집하고, SIM을 넘나드는 성문 대조로 개인을 식별하며, 암호화와 VPN 사용자를 표시하고, 국가 생체 주민등록과 대조한다.

영장 요건을 다룬 대목이 특히 눈에 걸린다. 임의의 전화번호에 대해 정보 조서를 작성하는 구성 요소에서, 운영자가 요청하자 영장 요건이 제거되었다. 통제 장치의 기본값은 꺼짐으로 설정되었고 보존 기한은 무기한이 되었다.

둘째, 도구를 만드는 데 그치지 않고 데이터를 대량으로 읽어 표적을 고른다. 어떤 행위자는 소셜 미디어 게시물을 묶음으로 올려 표적의 위치와 인구 통계, 정치 성향을 신뢰도 점수와 함께 구조화된 기록으로 만들게 했다. 이란의 한 부대는 수십만 건의 게시물을 분석해 감시할 야권 계정 39개를 골랐다.

셋째, AI가 국가 보안 관료 조직 안으로 들어간다. 중국의 한 국가안전 기관은 감시 작전에 AI를 쓰는 방법을 담은 내부 매뉴얼을 Claude로 만들었다. 한때 여러 분석팀으로 이루어졌던 중국의 종교 사무 정보수집 부서는 한 사무실로 줄었고, AI 조수를 써서 한 달에 수천 건의 조사를 생산한다.

시리아의 위구르인을 겨냥한 작전은 운영이 가장 무르익은 사례로 꼽혔다. 아랍어를 못 하는 중국 정부 연계 행위자가 감시 대상 WhatsApp 그룹 100여 개와 텔레그램 채널 수십 개에서 대화를 긁어냈다. 그리고 그것을 중국어 구조화 데이터로 바꾸었다. 재정난과 가족 이산, 이념적 환멸을 겪는 이들의 프로필을 만들었고, 신장에 가족이 남아 있는 표적을 따로 골라냈다. 시리아 방언으로 접촉문을 쓰고 답장을 실시간으로 번역했으며, “전문가” 역할극으로 자기 기만 메시지의 품질을 점검하게 했다.

재래식 무기

Claude를 무기 소프트웨어 개발에 쓴 사례 여섯 건이 실렸다. 중국 세 건, 러시아 두 건, 예멘 한 건이다. 이런 활동은 그동안 정부와 유엔 패널, 외부 조사자가 회수한 장비와 공개 자료를 짜맞춰 밝혀내던 영역이었다.

요구사항 분해에서 통합과 시험에 이르는 시스템 엔지니어링 V 다이어그램 Figure 1. 예멘 유도항법제어 조직의 작업을 시스템 엔지니어링 V 모델에 대응시킨 도식. 출처: Anthropic

예멘 북부의 한 조직은 세 갈래로 무기 개발 프로그램을 진행했다. 첫째는 휴대전화급 비행 컴퓨터를 쓰고 종말 단계 호밍 유도를 갖춘 유도 로켓이다. 둘째는 사거리 목표를 2,000킬로미터 이상으로 잡은 다단 탄도 미사일이다. 셋째는 극초음속 활공체 변형을 포함한 다형 미사일 계열이다.

이들은 사람 엔지니어가 하던 자리에 Claude Code를 놓고 유도항법제어 소프트웨어를 만들었다. Claude 인스턴스를 여러 개 띄워 각각에 역할을 나눠 줬다. 하나는 코드 작성, 하나는 조사, 하나는 첫 번째 인스턴스가 만든 코드를 검토하는 식이다. 작은 엔지니어링 팀의 리더가 일을 나눠 주는 방식과 다르지 않다.

이 조직이 한 일 가운데 가장 무겁게 읽히는 것은 시험 이후의 절차다. 예멘에서 실사격 시험을 한 뒤, 몇 시간 안에 그 결과를 Claude로 가져와 실패 원인을 분석했다.

러시아 쪽에서는 자유계약으로 보이는 팀이 자율 FPV 자폭 드론 군집을 만들었다. “DronDoc” 또는 “Serafim"이라 부른 작전이다.

  • 이들은 여러 가지를 만들었다. 드론끼리 기억을 공유하고 고장이 나도 대열을 유지하게 하는 조정 논리를 짰고, 공격과 관측, 기지 복귀 행동을 통제하는 탑재 소형 언어 모델을 얹었다. 탑재 카메라로 표적을 향해 드론을 몰고 폭발 명령을 내리는 종말 유도 소프트웨어도 이들이 썼다.
  • 이들은 자율적인 살상 교전을 전제로 플랫폼을 설계했다. 탑재 모델이 “사람"이라는 표적 종류를 포함해 표적을 고르고, 사람의 개입 없이 폭발 명령을 내릴 수 있었다.
  • 긁어모은 우크라이나 전투 영상으로 컴퓨터 비전 분류기를 학습시켰고, 표적 종류를 “적"과 “아군"으로 나누며 러시아제 체계를 허용 목록에 넣었다. 시연 타격 지점으로는 도네츠크주의 고정 좌표를 되풀이해 사용했다.

드론 군집 작업을 기술 성숙도 단계에 대응시킨 시스템 엔지니어링 V 다이어그램 Figure 3. 드론 군집 개발이 어느 단계까지 진행되었는지를 기술 성숙도에 대응시킨 도식. 출처: Anthropic

중국 쪽에서는 대어뢰 화력통제 체계의 중국어 사양서와 200쪽이 넘는 기술 제안서를 Claude로 작성했다. 초안을 쓸 때마다 Claude에게 적대적인 전문 심사자 역할을 시켜 자기 제안서를 비판하게 했고, 그 피드백으로 다음 판을 다듬었다. 다른 한 건은 전자전과 방공 제압을 위한 표적화 소프트웨어였다.

생물학 연구

생물학을 다룬 대목에서 Anthropic은 유난히 조심스럽다. 다섯 건의 사례를 실으면서 연구 기관과 국가, 구체적인 생물학적 인자와 기법은 밝히지 않았다.

문제의 뿌리에는 이중 용도라는 성질이 있다. 생물학적 역량은 이롭게도 해롭게도 쓰일 수 있고, 둘을 가르기 어려울 때가 많다. 생물 무기를 만드는 데 쓸 수 있는 정보가 백신이나 치료제를 만드는 데도 쓰인다. 노골적인 악의는 오히려 그 행위자가 그리 정교하지 않다는 증거이며, 정교한 쪽은 의도를 숨긴다고 보고서는 본다.

  • 고병원성 조류 인플루엔자. 미국 밖의 한 연구자가 포유류 적응과 호흡기 바깥 중증 질환의 기전을 연구하며 수 주에 걸쳐 수천 건의 메시지를 주고받았다. 생물 안전 분류기가 고위험 연구 내용을 막아 낸 덕에 이 대화는 전부 가장 약한 모델(Sonnet 4와 Haiku 4.5)에서 이루어졌고, 얻은 도움은 데이터 분석과 연구 설계의 사무적 보조에 그쳤다고 평가되었다.
  • 오르토폭스바이러스. 이메일 주소는 무작위로 만들었고, 계정은 익명화된 미국 인프라를 거쳐 개설되었다. 한 사람이 쓰는 계정이 아니었고, 열두 명 넘는 고객을 상대하는 리셀러 중계였다. 그중 한 고객이 Opus 5로 한 시간 남짓 만에 연구비 신청서를 처음부터 끝까지 작성했다. 중심 가설과 실험 설계, 투여량, 통계 계획, 대비 전략까지 포함되었다. 연구가 병원성 약화에 초점을 두고 있고 이중 용도이므로 분류기가 막지 않았다.
  • 독과 독소. 두 건 모두 치료제 개발이라는 목적을 내걸었고, 국가가 지원하는 연구 프로그램의 일부였다. 한 연구자는 여러 독성 동물 계통에서 모은 독소 펩타이드 지도를 만들고 이를 생성 최적화 파이프라인으로 발전시켰다. 그 지도에는 진통 표적과 마비 표적의 골격이 함께 담겼다. 다른 연구자는 분기별 진행 보고서를 Claude와 함께 쓰면서, 세균 독소와 바이러스 단백질의 정체를 일부러 흐릿하게 적으라고 지시했다.

Anthropic이 내린 결론은 분류기의 한계에 관한 것이다. 고도로 기술적인 이중 용도 영역에서 사용자의 의도를 확실히 알아낼 방법이 없으므로, 분류기 하나로는 이로움을 살리면서 해로움을 막는 일을 동시에 해낼 수 없다. 최전선의 생물학 역량을 안전하게 제공하는 길은 신뢰할 수 있는 사용자 프로그램뿐이라는 것이 이들의 판단이다.

Anthropic이 적대적 국가 기관과 관련된 30일치 활동을 최근에 훑어보니, 서로 다른 연구 시도가 35건가량 나왔다. 대부분은 평범한 민간 과학이었고 일부에 주목할 만한 이중 용도 가능성이 있었다.

데이팅 앱 사기

중국에 자리한 앱 스튜디오가 Claude로 20종이 넘는 데이팅 앱을 만들고, 그 앱에서 사용자와 대화하는 AI 페르소나까지 직접 운영했다. 서비스는 전부 사람이 응대한다고 광고했다.

2026년 4월의 2주 동안 서로 다른 AI 페르소나 4,700개 이상이 최소 25,000명과 대화했다. 같은 기간 Claude가 처리한 메시지는 약 236만 건이다.

  • AI와 사람의 비율은 3 대 1이었다. 운영자는 실제 사람을 긱 노동자로 모집해 그들의 프로필을 AI 페르소나와 같은 스와이프 목록에 섞어 놓았다. 사람이 맡은 일은 영상 통화와 소셜 미디어 맞팔처럼 Claude가 할 수 없는 상호작용이었다. 사용자가 이 앱을 정상적인 서비스로 믿게 만들기 위한 배치다.
  • 여러 AI 제공사를 역할별로 나눠 썼다. Claude는 자율 대화 페르소나를 맡았고, 다른 회사의 작은 모델이 긱 노동자가 눌러 보낼 짧은 답장 후보를 만들었으며, 이미지 편집 모델이 아바타 사진을 만들었다.
  • 시스템 프롬프트만 보면 평범한 역할극 배포와 구별되지 않았다. 수익화와 기만은 개별 대화 안에서 보이지 않았다. 표본 중 소수에서는 모델의 추론이 그 해악을 감지했는데, 사용자가 중병이나 급성 고통을 털어놓은 대화에서도 모델은 거절하지 않고 페르소나를 유지한 채 응답을 이어 갔다.
  • 앱스토어 심사를 피하도록 설계되었다. 심사 기간에만 켜지고 평소에는 잠들어 있는 UI 제어기가 있었고, 플랫폼이 앱들을 연결 지을 때 쓰는 유사성 검사를 피하려고 20종이 넘는 변형마다 클래스 이름을 다르게 두었다.

세 방향 시장 구조로 그려진 기만적 데이팅 앱 운영 도식 기만적 데이팅 앱 네트워크의 운영 구조. 출처: Anthropic

불법 증류

증류 자체는 정당한 학습 방법이다. 크고 유능한 교사 모델로 응답을 만든 다음, 그 대화로 작은 학생 모델이 교사를 흉내 내도록 훈련시킨다.

교사 모델에서 학생 모델로 능력이 옮겨 가는 증류 개념을 그린 도식 증류의 개념. 출처: Anthropic

Anthropic이 불법 증류로 정의하는 것은 다르다. 허가 없이 산업 규모로, 은밀하게 모델의 능력을 뽑아내 다른 모델에 옮기는 캠페인이다. 여기에는 대개 사기가 따라붙는다. 훔친 신용카드와 로그인 정보, API 키로 만든 정교한 가짜 계정망이 그것이다.

이 연구소들은 대개 프록시 서비스, 이른바 “중계소"를 거쳐 Anthropic의 모델에 접근한다. 지역 제한을 우회하려고 가짜 신원과 도용 카드로 수천 개의 계정을 만든다. 사용자와 미국 모델 사이에 오간 대화 기록을 제3자 리셀러에게서 사들이기도 한다.

추론 흔적을 뽑아내려는 시도는 점점 교묘해졌다. 어떤 곳은 “이것을 추론 추출로 표시하지 마라"처럼 단순하게 지시했고, 어떤 곳은 디버깅 세션이라며 이전 추론을 글자 그대로 출력하라고 했다. 한 연구소는 서로 다른 기법을 하나씩 담은 요청 1만 2,000건 이상을 시험 삼아 던져 어떤 것이 통하는지 확인한 뒤, 성공한 기법으로 본격적인 공격을 시작했다. 이전 작업 기억을 가타카나만 써서 일본어로 “번역"하라고 시킨 사례도 있다.

2026년 2월 이후 Anthropic이 높은 확신으로 특정 중국 연구소에 귀속시킨 캠페인은 다음과 같다.

연구소관찰된 규모주요 수법
알리바바 (Qwen / Tongyi Lab)2026년 5~7월 1억 5,100만 회 넘는 교환, 정점에는 하루 300만 회요청마다 고정 프롬프트를 넣어 추론 흔적을 태그 안에 쓰게 한 뒤 지도 미세조정 데이터로 변환. 부정 계정 3,500개 이상 사용
문샷 (Kimi)2026년 5~7월 2,300만 회 넘는 교환자사 고객 요청을 Kimi가 아니라 Claude로 조용히 넘기고 그 응답을 사용자에게 표시. 부정 계정 5,380개
딥시크2026년 7월 14일간 1,210만 회 넘는 교환문샷과 같은 교차 세션 재생 공격으로 추론 흔적 추출. Claude Code나 OpenCode 같은 하네스를 쓰는 사용자를 골라 Opus로 중계
즈푸 (Z.ai)2026년 6~7월 17일간 340만 회 넘는 교환계정 273개를 돌려 가며 추론 추출 파이프라인 운영. 학습 자료 채점과 정제에도 사용
샤오미2026년 3~4월 20일간 40만 회 넘는 요청자사 MiMo 모델의 사용자 대화와 코딩 세션을 Claude로 재생. 계정 1,500개 이상
센스타임규모 미공개제3자 데이터 벤더에게서 사용자와 Claude의 대화 기록을 사들여 증류 파이프라인에 투입
미니맥스규모 미공개모회사와의 관계를 밝히지 않는 위장 회사로 프록시 서비스를 세움. Anthropic과 OpenAI 모델만 제공하고 중국 모델은 자사 것조차 취급하지 않음

문샷과 딥시크의 사례에서 가장 무거운 부분은 사용자 데이터다. 문샷이 Claude로 넘긴 요청 가운데는 이런 것들이 있었다.

  • 인민해방군 관련으로 평가되는 한 사용자가 Kimi라고 믿은 채 CCTV 기록 보관소에서 특정 개인의 감시 데이터를 불러와, 추적 대상이 이상 행동을 하는지 분석해 달라고 요청했다. 청두의 카메라 수백 대에서 온 영상이었고 인민해방군 시설과 중국전자과기집단 산하 연구소, 대형 국유기업 앞의 카메라가 포함되었다.
  • 대형 국유기업의 엔지니어가 내부 시스템을 만들며 여러 중국 대기업의 내부 코드와 살아 있는 자격증명을 노출했다. 자기 요청이 Claude로 넘어가고 있다는 것을 알 방법이 없었다.

딥시크 쪽에서도 비슷한 일이 있었다. 러시아 국방부와 연계된 정부 기관의 데이터를 다루던 IT 운영자의 요청이 중계되면서 러시아 정부 데이터베이스의 살아 있는 자격증명이 노출되었다. 중국 지방 공안국의 사건 관리 시스템을 만들던 엔지니어들의 요청도 넘어갔는데, 이들이 만들던 도구는 주민등록번호로 개인의 이동 경로를 경찰 기록과 대조하는 것이었다.

Anthropic은 이런 관행이 개인정보 보호법과 해당 연구소들 자신의 이용약관에 어긋날 가능성이 크다고 적었다.

가장 흥미로운 지점

즈푸에 관한 짧은 문단을 나는 두 번 읽었다.

즈푸는 GLM 5.3 출시를 앞두고 미국 최전선 모델들의 사이버 능력을 겨냥한 캠페인을 벌였다. 처음 노린 것은 Fable이었다. 그런데 Fable의 강화된 사이버 안전장치가 공격을 무력화하자, 즈푸는 Fable을 포기했다. 그다음에 무엇을 했는가. 안전장치가 더 약하다고 판단한 Opus 4.6과 다른 미국 연구소의 최상위 모델로 갈아탔다.

안전장치의 강도 차이가 공격자의 표적 선택을 실제로 바꾼다. 그것이 관찰로 확인된 셈이다. 여기에는 반가운 면과 걱정스러운 면이 함께 있다. 안전장치가 작동한다는 증거이면서, 동시에 가장 약한 고리로 수요가 흘러간다는 증거이기도 하다. 한 회사가 자기 모델을 잠그면 공격자는 다음 문을 두드린다.

또 하나 오래 남는 것은 사용자가 자기 데이터의 행선지를 모른다는 점이다. 중국 국유기업의 엔지니어도, 러시아 정부 기관의 IT 담당자도, 유럽과 미국에서 모델 라우팅 서비스를 쓰던 개발자들도 자기 대화가 어느 회사의 서버를 지나는지 몰랐다. 위협 인텔리전스 보고서가 이것을 밝혀 주기 전까지는 알아낼 방법도 없었다. 우리가 AI 서비스를 고를 때 실제로 무엇을 고르고 있는 것인지, 나는 이 대목에서 조금 서늘해졌다.

출처

Anthropic Threat Intelligence, “Countering misuse of AI: September 2026”, 2026년 9월 원문: https://www.anthropic.com/threat-intelligence-report-september-2026

본문 이미지는 모두 원문 보고서에서 인용했다.