3줄 요약
- 상용 GEO 제품 Sitefire를 운영하는 요헨 마들러(Jochen Madler)가 2026년 9월 14일 arXiv에 이 논문을 올렸고, 9월 17일에 2판을 냈다. StoryScope는 AI가 쓴 소설을 서사 구조만으로 판별했는데, 이 논문은 그 방법을 기업 블로그 글에 그대로 적용해 결과가 재현되는지 확인했다. 저자는 ChatGPT 출시 이전에 268개 기업 도메인이 발행한 블로그 글 2,250편을 모으고, 각 글에서 역설계한 브리프로 다섯 AI 모델에게 글 1만 1,250편을 쓰게 한 뒤 두 묶음을 비교했다.
- 문체 특징을 제외한 구조 특징 187개로 학습한 분류기는 학습에 쓰지 않은 기업의 글에서 AI 글을 macro-F1 98.0으로 판별했다. 각 모델이 자기 글을 구간 단위로 고쳐 쓴 뒤에도 성능은 98.1이었다. 여섯 출처 가운데 하나를 무작위로 고르면 16.7%만 맞지만, 분류기는 인간과 다섯 모델 가운데 누가 글을 썼는지를 79.3%의 정확도로 맞혔다.
- AI 글에는 공통된 형태가 있었고, 저자는 여기에 “정돈되고 스스로를 예고하는 글(tidy, self-announcing)“이라는 이름을 붙였다. 이런 글은 제목에서 독자가 얻을 성과를 약속하고, 첫 섹션이 시작되기 전에 논지와 전개 순서를 밝히고, 편집자형 해설자의 목소리로 설명하고, 논지를 요약하는 단락으로 끝난다. 논문이 검증한 범위는 모델이 한 번에 생성한 글과 그 글을 같은 모델이 고쳐 쓴 글까지이며, 상용 휴머나이저 도구는 시험하지 않았다.
기업 블로그를 연구 대상으로 삼은 이유
논문은 연구 동기를 검색 시장의 변화에서 설명한다. ChatGPT나 Google AI Mode 같은 AI 검색 엔진에서는 LLM이 웹 페이지를 한 번 더 평가한다. 이 단계가 추가되면서 검색 엔진 최적화(SEO)의 후속 관행으로 생성형 엔진 최적화(GEO)가 등장했다. 논문이 인용한 선행 연구에 따르면, 웹 페이지 내용을 편집해 AI 검색 답변에서 그 페이지의 노출도를 최대 40% 올릴 수 있었다. 키워드 스터핑 같은 전통적 기법은 효과가 거의 없었다.
AI가 쓴 글의 비중에 관한 추정치도 함께 제시했다.
| 구분 | 대상 | 비중 |
|---|---|---|
| 학술 연구 | 미국 신문 기사 | 약 9%가 LLM의 도움을 받음 |
| 학술 연구 | 기업 보도자료 | 최대 24%가 LLM의 도움을 받음 |
| 업계 분석(Graphite) | 새로 발행된 영어 웹 기사 | 약 절반이 주로 AI로 작성됨 |
| 업계 분석(Ahrefs) | 새로 수집된 웹 페이지 | 약 4분의 3에 AI가 관여함 |
AI 글의 비중은 상업 웹에서 가장 높다고 저자는 판단했다. 상업 웹의 페이지는 트래픽과 사업 이익에 가장 직접 영향을 주기 때문이다. 이런 판단에 따라 상업 웹 페이지 가운데 기업 블로그 글을 연구 대상으로 정했다.
기존 탐지 방식의 약점도 동기로 제시했다. 단어 수준 탐지기는 손대지 않은 AI 글을 거의 완벽하게 판별하지만, 단어를 바꾸는 공격에 약하다. 논문이 인용한 연구에서 DetectGPT의 탐지율은 패러프레이즈 이후 70.3%에서 4.6%로 떨어졌다(오탐률 1% 기준). 학습된 분류기의 정확도는 AI가 고쳐 쓴 글에서 26%까지 내려갔다. 이런 공격을 자동화한 “휴머나이저” 도구는 이미 하나의 시장을 이루고 있다. Anthropic도 2026년 8월에 도입한 자사 텍스트 워터마크가 가벼운 편집 후에는 유지되지만 전면적인 재작성 후에는 유지되지 않는다고 밝혔다.
플랫폼 정책도 이미 단어 대신 결과와 구조를 판단 기준으로 삼는다. Google의 대량 생성 콘텐츠 남용 정책은 방법이 자동화든 사람이든 그 조합이든 상관없이 “사용자를 돕기보다 검색 순위 조작을 주목적으로 생성된” 대량 생산 페이지를 제재한다. YouTube는 계정 간 공조, 업로드 주기, 템플릿화된 서사 패턴 같은 구조 신호를 쓴다고 한다. 논문은 두 가지를 묻는다. AI가 쓴 상업 콘텐츠에도 고유한 구조가 있는가. 있다면 그 글은 어떤 논점을, 어떤 순서로, 어떤 근거와 어떤 목소리로 제시하는가.
StoryScope의 재현
StoryScope(Russell 외, 2026)는 문체 신호 없이 서사 구조만으로 AI 소설을 macro-F1 93.2로 판별했고, 인간이 쓴 소설이 통계적으로 드문 서사 구조를 가진다는 결과도 보고했다.1 이 논문은 StoryScope의 다섯 단계 파이프라인(템플릿 추출, 출처 간 비교, 특징 발견, 중복 제거, 특징 적용)과 다섯 AI 모델, 분류기 프로토콜과 평가 지표를 그대로 유지했다. 도메인에 맞추려고 바꾼 부분은 16개 항목의 이탈 목록(deviation register)으로 공개했다. 이탈 목록에는 기업 도메인 단위의 데이터 분할, 인간 글에서 새로 도출한 상업 콘텐츠 스키마, StoryScope의 4.5분의 1 수준인 말뭉치 규모, 다섯 모델 모두에게 적용한 자기 재작성 시험 등이 들어 있다.
그림 1. 연구 파이프라인. 출처: Madler (2026), arXiv:2609.15369, arXiv 비독점 배포 라이선스
데이터
인간 글은 다른 기업에 상품이나 서비스를 파는 B2B 기업 가운데, 자연 검색으로 고객을 유치할 가능성이 있는 기업의 블로그에서 수집했다. 모든 글은 Wayback Machine에 2008년에서 2022년 사이에 저장된 스냅샷에서 가져왔으며, 전부 ChatGPT 출시 이전의 글이다.
| 단계 | 기준 | 결과 |
|---|---|---|
| 표본 틀 구성 | 공개 기업 목록 네 개(Inc5000 9,979곳, YC 디렉터리 3,448곳, FT1000 1,129곳, G2 519곳) | 도메인 1만 5,075개 |
| 기업 적합성 선별 | LLM 판정 모델 두 개가 기업 정보와 홈페이지 메타데이터로 판단 | 94.3% 유지 |
| 아카이브 분량 확인 | 2022년 11월 30일 이전에 저장된 아티클 URL이 25개 이상 | 698곳 통과 |
| 장르 표본 점검 | 도메인마다 글 5편의 언어, 정보성 여부, 분량 확인 | 307곳 |
| 업종 할당 | 소프트웨어 업종 비중 상한 40% | 306곳 |
| 수집과 필터 | 600~2,500단어, 영어, 정보성 장르, 유사 중복 제거 | 268개 도메인의 2,250편2 |
AI 글은 인간 글마다 콘텐츠 브리프를 역설계해 생성했다. 브리프에는 발행 기업의 이름과 판매 상품을 넣어, 해당 기업이 글을 의뢰한 상황을 재현했다. 글의 상업적 목표 같은 분석용 라벨은 작성 모델에게 전달하지 않았다. 작성 모델은 StoryScope와 같은 다섯 종(gpt-5.4, claude-sonnet-4.6, gemini-3-flash, deepseek-v3.2, kimi-k2.5)이다. 인간 글 한 편과 그 브리프, 그리고 다섯 모델이 쓴 미러 글 다섯 편을 묶어 “프롬프트” 하나로 부른다.
AI 글은 모델별 평균 1,064~1,541단어로 인간 글보다 조금 길었다. 하지만 단어 수 하나만으로 학습한 분류기는 인간 글과 AI 글을 판별하지 못했다(macro-F1 45.5).
프롬프트 100개(600편)는 특징 발견 전용으로 지정하고 모든 분류 실험에서 제외했다. 나머지 2,150개 프롬프트는 기업 도메인 단위로 학습 1,566개, 검증 294개, 시험 290개로 분할했다(도메인 기준 198개, 32개, 38개). 한 도메인의 글은 학습, 검증, 시험 가운데 하나에만 배정했다. 따라서 특정 기업의 어조를 학습한 분류기가 시험에서 같은 기업의 글을 알아보는 일은 없다. StoryScope는 프롬프트를 무작위로 분할했으므로 이 논문의 분할 기준이 더 엄격하다.
측정 도구를 만든 과정
StoryScope의 템플릿 스키마는 플롯, 인물, 감정 궤적처럼 소설에 맞춘 요소로 구성되어 있다. 그래서 저자는 인간 글에서 상업 콘텐츠용 스키마를 새로 도출했다. 이를 위해 gpt-5.6-terra를 독립적으로 세 차례 실행했다. 각 실행에서 층화 추출한 인간 글 18편을 검토하게 했고, 세 차례 모두 거의 같은 차원 체계가 도출됐다. 최종 스키마는 목적, 독자, 구조와 흐름, 설명, 근거, 목소리, 실행 가능성, 상업적 통합, 시의성, 페이지 형식, 문체의 11개 차원이다. 문체 차원은 별도로 두어 분석에서 제외할 수 있게 했다. 논문의 구조 분석 결과는 모두 문체 특징을 제외하고 계산했다.
특징 목록은 다음 단계를 거쳐 확정됐다.
| 단계 | 내용 | 남은 특징 |
|---|---|---|
| 특징 발견 | 프롬프트마다 여섯 편의 템플릿을 gpt-5.6-terra에 한꺼번에 주고 출처 간 차이를 기록하게 함. 차원별 전용 프롬프트로 세 번 독립 실행 | 457개 |
| 품질 게이트 | 본문만으로 답할 수 있는가, 근거를 특정할 수 있는가, 문구만으로 뜻이 통하는가, 복합 구성이 없는가를 평가. 후보의 38.3% 탈락 | 282개 |
| 중복 제거 | F2LLM-4B 임베딩, 코사인 0.85 기준 단일 연결 군집에서 군집당 하나만 유지 | 266개 |
| 신뢰도 필터 | 98% 이상이 같은 답인 특징 11개, 선택지 밖 답이 2%를 초과한 특징 3개, 반복 채점에서 불안정한 특징 38개 제외 | 214개(구조 187개, 문체 27개) |
채점은 gemini-3.6-flash가 맡았다. 한 번 호출할 때 차원 하나씩 채점했고, 모델은 특징마다 미리 정한 선택지 중 하나만 고르도록 강제됐다. 1만 3,500편을 11개 차원으로 채점하는 데 호출 14만 8,500회가 들었다. 신뢰도 필터는 인간과 AI 라벨을 보지 않은 상태에서 채점 결과의 통계만으로 적용했다.
LLM이 측정 전 과정을 수행하므로, 저자는 측정 도구의 신뢰도를 두 가지 방식으로 검증했다. 먼저 같은 글 60편을 다섯 번 독립 채점했을 때 Krippendorff alpha는 0.891이었다(기준 0.8, StoryScope 0.90). 다음으로 주석자 두 명에게 글 12편의 특징 20개씩, 모두 240문항에 독립적으로 답하게 했다. 통과 기준은 주석 작업 전에 kappa 0.60 이상으로 정해 두었다.
| 비교 | 일치율 | Cohen’s kappa | StoryScope |
|---|---|---|---|
| 인간 대 인간 | 93.22% | 0.928 | 76.85% / 0.739 |
| 주석자 A 대 모델 | 94.49% | 0.9414 | 91.67% / 0.9056 |
| 주석자 B 대 모델 | 95.34% | 0.9502 | 79.86% / 0.7724 |
| 인간 대 모델 평균 | - | 0.946 | 0.839 |
LLM 채점기와 인간 주석자의 일치도는 StoryScope의 경우보다 높았고, StoryScope의 인간 주석자끼리의 일치도보다도 높았다.3
탐지 성능
논문은 평가 지표로 macro-F1을 썼다. 한 프롬프트에는 인간 글 한 편과 AI 글 다섯 편이 있다. 이 구성에서는 모든 글을 AI로 판정하는 탐지기도 정확도 83.3%를 얻는다. macro-F1은 인간 글과 AI 글에 대한 탐지 품질을 같은 비중으로 평균한다.
| 변형 또는 기준선 | 특징 수 | 시험 macro-F1 | AUPRC | StoryScope |
|---|---|---|---|---|
| 구조 특징(대표 결과) | 187 | 98.0 | 1.000 | 93.2 / .959 |
| 문체 특징만 | 27 | 88.1 | .994 | 85.8 / .867 |
| 전체 특징 | 214 | 98.1 | 1.000 | 96.0 / .982 |
| 핵심 특징만 | 10 | 93.5 | .996 | 30개: 84.8 / .828 |
| 핵심 특징과 모델별 특징 | 33 | 95.9 | .999 | 101개: 91.1 / .934 |
| ModernBERT-base 미세 조정 | - | 100.0 | 1.000 | 99.9 / 1.00 |
| 스타일로메트리와 XGBoost | 144 | 100.0 | 1.000 | 99.8 / .999 |
| TF-IDF(1~2그램)와 XGBoost | 5,000 | 99.3 | 1.000 | 99.7 / .999 |
구조 분류기의 macro-F1 98.0에 대해 기업 도메인 단위 부트스트랩으로 구한 95% 신뢰구간은 96.7~99.2다. 단어 수준 탐지기인 ModernBERT와 스타일로메트리 기준선은 손대지 않은 글에서 만점을 받았고, 구조 분류기는 이보다 2포인트 낮았다.4 전체 특징, 구조 특징, 문체 특징 순서로 성능이 높은 것은 StoryScope와 같다. 구조 분류기의 AUPRC는 반올림 전 값이 0.9998이다. 이 값대로라면 분류기는 AI 글과 인간 글의 순위를 거의 완벽하게 매기며, 남은 오답은 판정 임계값을 정하는 단계에서 생긴다고 저자는 해석했다.
저자는 실험 전에 문체 특징이 구조 특징보다 성능이 좋을 것이라는 가설을 세웠다. 상업 글은 브랜드 어조로 설득하는 글이므로 문체가 소설보다 더 많은 신호를 담을 수 있다는 추론이었다. 결과는 반대였다. 구조 분류기가 문체 분류기보다 macro-F1이 9.9포인트 높았다(95% 신뢰구간 6.0~14.2).
두 분류기가 틀린 글도 달랐다. 시험 글 1,740편 가운데 구조 분류기는 19편, 문체 분류기는 101편을 잘못 판정했는데, 두 분류기가 함께 틀린 글은 4편뿐이었다. 구조 특징이 표면 문체를 다른 형태로 다시 인코딩한 것에 불과하다면, 두 분류기는 같은 글에서 틀렸어야 한다. 하지만 공통 오답은 거의 없었고, 저자는 이 결과를 두 특징 묶음이 서로 다른 신호를 측정한다는 증거로 제시했다.
모델이 자기 글을 고쳐 써도 탐지된다
두 번째 가설은 구조 탐지가 재작성 공격에 견딘다는 것이었다. 이를 시험하려고 시험 분할의 AI 글 1,450편을 각각 그 글을 쓴 모델에게 다시 쓰게 했다. 편집은 Chakrabarty 외(2025)가 전문 편집자와 함께 정리한 AI 글의 결함 일곱 범주를 기준으로 했다. 글은 구간 단위로 고쳤고, 주장과 정보, 링크는 그대로 유지했다.
재작성 강도는 이렇게 측정됐다. 판정 모델로 원본과 재작성본 1,450쌍을 검사했을 때 98.2%가 모든 주장을 보존했고, 나머지는 세부 사항 하나씩만 달랐다. 원본에 있던 13단어짜리 연속 구절 가운데 평균 73%는 재작성본에 그대로 나타나지 않았다. 20편을 표본으로 채점해 보니 특징 답의 15.6%가 바뀌었는데, 같은 글을 두 번 채점할 때도 10.7%가 바뀐다.
| 변형 | 원본 | 재작성본 |
|---|---|---|
| 구조 특징(187개) | 98.0 | 98.1 |
| 문체 특징만(27개) | 88.1 | 87.1 |
| 전체 특징(214개) | 98.1 | 97.9 |
재작성한 1,450편 가운데 인간 글로 오판된 것은 8편이었다. 같은 글들이 재작성 전에 오판된 수는 9편이다. 모델별 성능은 97.6~98.1로 고르게 나왔다. 어떻게 쓰는지를 보는 문체 특징은 예상대로 성능이 조금 떨어졌다. 저자의 설명에 따르면 재작성으로 바뀐 특징 답은 글마다, 특징마다 제각각이었고, 인간 글의 전형적인 구조와 같은 답으로 바뀌는 경향도 없었다. 그러다 보니 187개 특징 전체를 한꺼번에 보는 분류기는 거의 영향을 받지 않았다. StoryScope는 한 모델만 재작성에 쓴 실험에서 1.6포인트 하락을 보고했다. 이 논문에서는 다섯 모델이 모두 자기 글을 고쳐 썼는데도 성능이 떨어지지 않았다.
어느 모델이 썼는가
인간과 다섯 모델 중 누가 썼는지를 맞히는 여섯 출처 분류기도 학습했다. 시험 분할에서 정확도는 79.3%, macro-F1은 79.2였다. 무작위로 고를 때의 정확도는 16.7%이고, StoryScope의 정확도는 68.4%였다.
| 출처 | 이 논문의 F1 | StoryScope(문체 제외) |
|---|---|---|
| 인간 | .966 | .89 |
| GPT | .855 | .73 |
| Claude | .830 | .77 |
| Kimi | .747 | .55 |
| Gemini | .698 | .60 |
| DeepSeek | .654 | .57 |
그림 2. 여섯 출처 분류기의 혼동 행렬(행 기준 %). 출처: Madler (2026), arXiv:2609.15369, arXiv 비독점 배포 라이선스
인간 글은 거의 완벽하게 식별됐고, 남은 오류는 대부분 AI 글을 다른 AI 모델의 글로 판정한 경우였다. 가장 식별하기 어려운 모델은 DeepSeek V3.2였다. DeepSeek의 글은 61%만 정답으로 분류됐고, 18%는 Gemini 3 Flash의 글로, 10%는 Kimi K2.5의 글로 분류됐다.
저자는 여섯 출처 분류기에서 한 출처의 식별에 SHAP 기여도가 특히 큰 특징 30개를 모델별 특징으로 골랐다. 출처별 개수는 인간 17개, GPT 6개, DeepSeek, Gemini, Kimi 각 2개, Claude 1개다. 논문 부록이 출처마다 최대 다섯 개씩 제시한 특징은 다음과 같다.5
| 출처 | 해당 출처의 식별에 기여도가 큰 특징 |
|---|---|
| 인간 | 실행 지원 자료, 판단 규칙 제시, 잘못된 기본 가정에 대한 반박, 걸린 이해관계의 점증, 외부 목소리의 구성 |
| GPT | 산출물 제작 요구, 한계나 단서의 제시, 수치 밀도, 비교 수치의 기준값 공개, 정량 주장의 출처 |
| Claude | 번호를 매긴 절차 |
| Gemini | 자기 언급 빈도, 근거의 한계 공개 |
| DeepSeek | 운영 임계값 사용, 독자에게 요구하는 변화 |
| Kimi | 자사 권위 주장, 상업적 행동 유도(CTA)의 강도 |
AI 글의 형태
그림 3. 구조 분류기의 상위 20개 특징(부트스트랩 재적합 평균 절대 SHAP). 진한 막대가 핵심 특징이다. 출처: Madler (2026), arXiv:2609.15369, arXiv 비독점 배포 라이선스
SHAP은 모델의 예측 하나하나에 대해 각 특징이 기여한 몫을 계산하는 방법이다. 상위 특징들은 논증의 단계 구성, 목적과 성과를 제시하는 방식, 독자를 부르는 방식, 출처를 밝히는 방식에 관한 것이었다.
저자는 StoryScope의 핵심 특징 선정 절차를 따라 이 순위에서 핵심 값 10개를 추렸다. 선정 조건은 네 가지다. SHAP 중요도는 상위 25%에 속해야 한다. 데이터를 재표집해 모델을 50번 다시 학습해도 중요도가 유지돼야 하며, 라벨을 무작위로 재배정했을 때보다 기여도가 뚜렷이 커야 한다. 다섯 AI 모델 모두에서 인간과 AI의 답 차이도 크고 일관돼야 한다. 그 결과 특징 10개에서 값 하나씩이 선정됐다(StoryScope는 특징 30개의 값 33개).
| 특징 | 값 | 가리키는 출처 | 인간과 AI의 답 차이 |
|---|---|---|---|
| 결론 처리 방식 | 논지를 재진술하거나 재구성 | AI | 0.650 |
| 성과를 처음 약속하는 곳 | 제목 | AI | 0.624 |
| 기능 단계 구성 | 요약이나 종합 단계가 있음 | AI | 0.609 |
| 외부 참여 경로 | 없음 | AI | 0.592 |
| 옛 방식과 새 방식의 대비 | 없음 | 인간 | 0.497 |
| 첫 단위 이전의 논지 제시 | 없음 | 인간 | 0.419 |
| 걸린 이해관계의 점증 | 없음 | 인간 | 0.362 |
| 주된 목소리 | 편집자형 해설자 | AI | 0.308 |
| 글 길이 등급 | 800단어 미만 | 인간 | 0.274 |
| 문제를 제시하는 순서 | (순서값) | 인간 | 0.222 |
열 가지 특징의 모델 기여도 합계는 전체의 27.6%였다. 이 열 가지 특징으로만 학습한 분류기도 macro-F1 93.5를 기록했다(StoryScope는 30개로 84.8). 핵심 특징이 더 적은데도 성능이 더 높은 이유에 대해 저자는 두 가지 가능성을 들었다. 하나는 특징 발견 단계의 품질 게이트이고, 다른 하나는 기업 블로그가 소설보다 동질적이라는 점이다.
AI 글에서 주로 나타나는 값을 함께 보면, 저자가 “정돈되고 스스로를 예고하는 블로그 글"이라고 부른 형태가 드러난다. 논문은 전형적인 AI 글을 이렇게 예시했다.
In a typical AI post, the payoff is promised in the title: “How to Cut Onboarding Time in Half.” The thesis is stated and the flow announced before the first section: “In this post, we’ll cover why onboarding stalls, three fixes that work, and how to measure the difference.” And the close restates the thesis: “In short, structured onboarding saves time.”
제목은 “온보딩 시간을 절반으로 줄이는 법"처럼 독자가 얻을 성과를 약속한다. 첫 섹션 전에는 “이 글에서는 온보딩이 지연되는 이유, 효과가 있는 해결책 세 가지, 그 차이를 측정하는 방법을 다룬다"처럼 논지와 전개 순서를 밝힌다. 마지막 단락은 “요컨대 구조화된 온보딩은 시간을 절약한다"처럼 논지를 되풀이한다. 반대로 인간 글에서 주로 나타나는 값은 이런 이정표가 없다는 것을 뜻한다. 인간 글은 전개 순서를 예고하거나, 걸린 이해관계를 점점 강조하거나, 결말 단락에서 논지를 재진술하는 경우가 적었다.
인간 글은 드문 구조를 가진다
저자는 StoryScope를 따라 통계적 희소성을 독창성의 대리 지표로 썼다. 희소성은 글마다 계산한다. 표준화한 구조 특징 벡터로 최근접 이웃 25편과의 평균 유클리드 거리를 구한 뒤, 학습과 검증 데이터의 분포를 기준으로 백분위로 환산한다. 흔한 구조를 가진 글은 비슷한 글이 많아 점수가 낮고, 드문 구조를 가진 글은 점수가 높다. 글 첫머리의 커버 그림이 출처별 희소성 분포를 보여 준다.
| 통계 | 이 논문 | StoryScope |
|---|---|---|
| 인간 글의 평균 희소성 백분위 | 0.838 | 0.71 |
| AI 글의 평균 희소성 백분위 | 0.435 | 0.49 |
| Cohen’s d | 1.83 | 0.83 |
| 희소성 하나로 판별한 AUC | 0.901 | 0.73 |
| 프롬프트 여섯 편 중 인간 글이 가장 드문 비율(무작위 16.7%) | 85.5% | 57.8% |
| 가장 드문 10%에 드는 비율(인간 글 / AI 글) | 47.7% / 2.8% | 24.7% / 7.1% |
희소성이 기준 분포의 99번째 백분위보다 높은 글에서는 차이가 더 컸다. 이런 글은 인간 글이 149편, AI 글이 4편이었다. StoryScope에서는 가장 드문 1%가 인간 42편, AI 41편으로 거의 반반이었다.
모델별 평균 희소성은 DeepSeek 0.547, Claude 0.483, Gemini 0.461, Kimi 0.356, GPT 0.329 순서다. 인간 글과 가장 비슷한 모델은 DeepSeek이었고, 이는 DeepSeek의 글이 출처 식별에서 가장 어려웠던 결과와 일치한다. 길이를 맞춘 표본에서도 이 순서는 유지됐다. 부록의 기하 분석에서는 인간 글과 최근접 이웃 10편 사이의 평균 거리가 AI 글의 경우보다 1.43배 컸고, 인간 글 전체의 분산은 AI 모델별 분산의 평균보다 1.42배 컸다.
견고성 점검
저자는 설계상 교란 요인을 점검하는 여덟 가지 검사를 했다.
| 점검 | 결과 |
|---|---|
| 길이 교란 | 인간 글과 AI 글의 길이를 맞춘 시험 표본 1,545편에서 98.1(맞추지 않았을 때 98.0). 희소성 격차는 d = 1.87 |
| 발행 연도 | 구조 특징으로 인간 글의 발행 시기를 예측하면 무작위 수준(macro-F1 49.3, 다수 클래스만 고를 때 47.3) |
| 특징 발견 경로 | 템플릿 없이 원문에서 직접 특징을 찾으면 후보 수는 같지만 의미가 같은 특징은 약 23% |
| 중복 제거 기준값 | 0.70~0.95 구간에서 특징 수는 200~282개로 변하지만 결론은 같음 |
| 특징 발견용 도메인 중복 | 시험 분할과 공유하는 도메인 11개를 제외하면 98.2 |
| 암기 | 인간 글과 미러가 13단어 연쇄를 공유하는 쌍 0.19%(무작위 대조군 0.0%), 제외하면 97.9 |
| 업종 차이 | 업종별 macro-F1 96.5~100, 유의한 차이 없음(Kruskal-Wallis p = 0.109) |
| 학습 곡선 | 학습 데이터의 약 75%에서 성능이 포화(98.0) |
글의 게시일 당시 존재하지 않던 개체를 언급한 글은 0.08%였고, 이 글들을 제외해도 대표 결과는 변하지 않았다.
저자가 밝힌 한계
- 검증 범위. 역설계한 브리프에 대한 모델의 첫 응답과, 그 글을 같은 모델이 고쳐 쓴 글만 다뤘다. 휴머나이저 도구로 가공한 글, 대폭 후처리한 글, 사람과 AI가 함께 쓴 글은 다루지 않았다.
- 브리프의 정보 손실. 인간 저자는 사업 맥락 전체를 알고 글을 썼지만 모델은 역설계한 브리프만 받았다. 그러므로 구조 차이의 일부는 모델의 글쓰기 습관보다 브리프가 전하지 못한 정보에서 비롯됐을 수 있다. StoryScope에도 같은 한계가 있다.
- 발행 시기 교란. 인간 글은 ChatGPT 이전에 쓰였고 AI 글은 2026년 8월에 생성됐다. 구조 특징으로 발행 연도를 예측할 수 없다는 점검 결과가 있지만, 같은 시기에 쓰인 인간 글과의 비교는 아직 수행되지 않았다.
- 효과 크기. 모든 효과가 StoryScope와 방향이 같고 크기는 더 컸다. 저자는 특징 발견 단계가 이 여섯 출처를 판별하도록 최적화됐고 도메인에 맞춘 스키마가 효과를 증폭했을 것으로 보았다. 그래서 상업 콘텐츠가 소설보다 본래 판별하기 쉽다고 주장하지 않고, 효과가 재현된다는 점만 주장했다.
- 말뭉치 규모와 구성. 프롬프트는 2,250개로 StoryScope의 1만 272개보다 적다. 출처별 식별과 희소성 극단 통계는 검정력이 부족하다. 말뭉치는 소프트웨어 업종과 미국 기업의 비중이 높고, 스냅샷의 75.5%가 2020~2022년의 것이다.
- 이해관계. 저자는 상용 GEO 제품 Sitefire를 운영한다.
데이터 수집 파이프라인, 214개 특징의 측정 도구 전체, 재작성 공격 프롬프트를 포함한 프롬프트 전체, 분석 코드와 집계 산출물은 GitHub에 공개했다. 글 단위 데이터는 연구자가 요청하면 제공한다.
읽으며 뜨끔했던 대목
핵심 특징 표를 읽다가 이 다이제스트의 형식을 점검하게 됐다. 서재의 다이제스트는 본문을 시작하기 전에 “3줄 요약"으로 결론을 먼저 밝히고, 편집자형 해설자의 목소리로 자료를 정리한다. 논문이 AI 글의 특징으로 꼽은 “첫 단위 이전의 논지 제시"와 “편집자형 해설자"를 템플릿 단계에서 이미 갖춘 셈이다. 서재에서 AI 글투를 줄이려고 해 온 교정은 대부분 어휘와 문장 단위였다. 이 논문의 측정 방식으로 보면 그런 교정은 문체 특징 27개가 재는 신호에 주로 영향을 준다. 재작성 실험에서 성능이 하락한 것도 문체 분류기(88.1에서 87.1)였고, 구조 분류기의 성능은 98.0에서 98.1로 거의 같았다.
재작성 시험의 해석도 흥미로웠다. 저자는 무작위로 바뀐 특징 답이 탐지를 피하는 데 도움이 되지 않았다고 설명했다. 달리 말하면, 인간 글의 구조를 알고 그 구조를 목표로 고친 글은 이 실험에서 시험하지 않았다. 논문 결론에는 “The instrument also reads both ways"라는 문장이 있다. AI 글이 쓰는 흔한 구조를 판별하는 특징들로 인간 글의 드문 구조도 식별할 수 있다는 뜻이다. 저자가 GEO 제품을 운영한다는 점을 고려하면, 같은 도구가 탐지기이면서 글을 인간 글의 구조로 고치는 지침으로도 쓰일 수 있다. 논문은 그런 용도를 직접 언급하지 않는다.
출처
Jochen Madler (Sitefire), “SlopShape: Identifying AI-Generated Commercial Web Content”, arXiv:2609.15369 [cs.CL]. 1판 2026년 9월 14일, 2판 2026년 9월 17일.
원문: https://arxiv.org/abs/2609.15369
공개 자료: https://github.com/pulse-energy-eu/slopshape
StoryScope의 수치와, 그 결과를 글쓰기 규칙으로 구현한 오픈소스 스킬은 sepia 다이제스트에서 다뤘다. ↩︎
처음 선정한 306개 도메인 가운데 264개에서 쓸 수 있는 글이 나왔다. 40개는 수집 가능한 글이 없었고 2개는 콘텐츠 필터에서 글이 모두 빠졌다. 수집 도중 같은 자격 풀에서 대체 도메인 4개를 뽑아 268개가 됐다. ↩︎
두 주석자는 모두 저자의 회사 소속이다. 주석자들은 모델이 문체와 구조를 구분한 판정도 따로 검토했고, 그 구분에 동의했다(모든 kappa가 기준 0.75 이상). ↩︎
스타일로메트리 기준선의 만점에는 어휘보다 글 형식의 영향도 섞여 있다. 인간 글 중에는 인터뷰, 녹취록, 라운드업 형식이 있는데 AI 미러는 이런 형식을 거의 만들지 않았다. 일반적인 단독 페이지 형식의 인간 글(86.5%)로 한정해도 구조 분류기의 성능은 97.5였다. 제로샷 탐지기 Binoculars는 원 연구의 Falcon-7B 쌍 대신 작은 Qwen2.5-0.5B 쌍으로 대체해 78.2를 기록했다(원 연구 55.9). ↩︎
부록 표는 특징 이름만 제시하고, 그 특징의 값이 많은지 적은지는 밝히지 않는다. 예를 들어 GPT의 “수치 밀도"는 GPT 글을 식별할 때 이 특징의 기여도가 크다는 뜻이다. 이 표만으로는 GPT 글의 수치 밀도가 높은지 낮은지 알 수 없다. ↩︎
