AI 에세이 탐지기의 작동 방식(및 완벽하지 않은 이유)
팀 · SUS IT 편집팀
Tim은 탐지 방법론에 중점을 둔 소프트웨어 엔지니어이자 AI 연구원입니다.
AI 텍스트 감지의 이면에 있는 통계적 방법 — 난해함, 폭발성, 그리고 최고의 감지기라도 인간의 글에 대해 오탐지가 발생하는 이유.
AI 글쓰기 감지기는 교육 및 편집 워크플로우의 표준 부분이 되었습니다. 도구는 학생 제출물을 검사하여 ChatGPT 및 Gemini 서명을 확인하고, 출판사는 원고에서 AI로 작성된 섹션을 확인하고, 플랫폼 화면에서 AI 생성 스팸을 확인합니다. 하지만 이러한 시스템은 실제로 어떻게 작동하며, 때때로 인간의 글을 AI가 생성한 것으로 표시하는 이유는 무엇입니까? 메커니즘을 이해하면 이러한 도구를 적절하게 사용하고 확률적 점수를 최종 판정으로 취급하는 것을 방지하는 데 도움이 됩니다.
핵심 문제: 텍스트는 단지 통계일 뿐입니다
자연어는 기본적으로 통계적인 현상입니다. 모든 단어 선택, 문장 구조, 단락 리듬은 읽기와 경험을 통해 학습된 패턴을 반영합니다. AI 언어 모델은 인간이 작성한 방대한 양의 텍스트에 대해 훈련을 받습니다. 즉, 통계적으로 그럴듯한 인간 언어를 생성하는 방법을 학습합니다. 안타깝게도 바로 이것이 감지하기 어렵습니다. 감지 시스템의 과제는 다양한 주제, 스타일 및 컨텍스트에 걸쳐 지속되는 인간 생성 텍스트와 AI 생성 텍스트 간의 미묘한 통계적 차이를 찾는 것입니다.
당혹감: 각 단어는 얼마나 예측 가능한가?
AI 텍스트 감지에서 가장 널리 사용되는 측정항목은 당혹성(perplexity)입니다. 이는 이전 컨텍스트에서 각 단어가 언어 모델을 얼마나 놀라게 하는지를 측정하는 것입니다. 인간의 글쓰기는 더 높은 당혹감을 느끼는 경향이 있습니다. 예상치 못한 단어를 선택하고, 새로운 아이디어를 도입하고, 관용어나 전문 용어를 특정한 방식으로 사용하고, 통계 모델이 낮은 확률로 할당하는 언어적 위험을 감수합니다. 가능성을 최대화하도록 훈련된 시스템에 의해 생성되는 AI 생성 텍스트는 복잡성이 낮아지는 경향이 있습니다. 즉, 문맥상 적절하고 일반적이며 예측 가능한 단어 선택입니다. 복잡도가 낮은 텍스트가 지속적으로 전달되는 것은 언어 모델이 해당 텍스트를 생성했을 수도 있다는 신호입니다.
폭발성: 복잡성은 얼마나 다양합니까?
두 번째 주요 신호는 폭발성, 즉 구절 내 문장 길이, 구조 및 복잡성의 가변성입니다. 인간의 글쓰기는 자연스럽게 "폭발"합니다. 길고 복잡한 문장 뒤에 짧은 문장이 나오고, 조밀한 기술적 내용이 담긴 문단 뒤에 비유가 나오고, 형식적인 진술 뒤에 캐주얼한 문장이 이어집니다. AI 언어 모델은 일관된 복잡성을 갖는 경향이 있습니다. 각 문장은 비슷한 깊이와 구조로 다소 독립적으로 생성되어 원활하게 흐르지만 들쭉날쭉하고 인간적인 자연스러운 사고 특성이 부족한 텍스트를 생성합니다. 탐지 시스템은 텍스트 전체에서 이러한 속성의 통계적 변화를 측정합니다.
이러한 지표가 완벽하지 않은 이유
탐지 신호로서의 당혹감과 폭발성의 문제는 그것이 저자의 속성이 아니라 텍스트의 속성이라는 것입니다. 학생들에게 요구되는 형식적인 학문적 글쓰기는 설계상 복잡성이 낮고 폭발성이 낮은 경향이 있습니다. 엔지니어링 보고서, 법적 개요 또는 과학적 방법 섹션은 명확하고 예측 가능하며 일관되게 구성되어야 합니다. 이는 AI세대가 아닌 좋은 정형화된 글쓰기의 특징이다. 제2언어의 관용어 범위 전체를 사용하지 않는 다국어 작가는 통계적으로 더 예측 가능한 텍스트를 생성하는 경향이 있습니다. 거짓 긍정은 탐지기가 고장났다는 신호가 아닙니다. 이는 통계가 합법적으로 겹치는 도메인에 통계 측정을 적용한 본질적인 결과입니다.
훈련 데이터 문제
AI 텍스트 감지기는 알려진 인간 및 알려진 AI 텍스트의 데이터 세트에 대해 훈련됩니다. 이러한 데이터 세트의 품질과 다양성은 근본적으로 탐지 정확도를 제한합니다. ChatGPT 3.5 출력에 대해 주로 훈련된 탐지기는 통계 속성이 다른 Claude 3.5 또는 GPT-4o 출력에 잘 일반화되지 않을 수 있습니다. 영어 텍스트에 대해 훈련된 탐지기는 다른 언어에서는 제대로 작동하지 않을 수 있습니다. 감지기는 생성 모델이 향상됨에 따라 정확성을 유지하기 위해 새 모델 출력을 지속적으로 재교육해야 하며, 새 모델의 출시와 출력을 안정적으로 식별하는 감지기의 능력 사이에는 항상 지연이 있습니다.
제로샷 대 미세 조정 감지
일부 감지 시스템은 "제로샷" 접근 방식을 사용합니다. 사전 훈련된 언어 모델을 직접 적용하여 작업별 훈련 없이 복잡성을 추정합니다. 다른 사람들은 레이블이 지정된 예제를 사용하여 AI 감지를 위해 특별히 분류기를 미세 조정합니다. 제로샷 방법은 더 투명하지만(측정 대상을 정확히 이해할 수 있음) 정확도가 떨어지는 경향이 있습니다. 미세 조정된 분류기는 훈련 분포에서 더 높은 정확도를 달성할 수 있지만 특정 모델 계열에 과적합될 수 있습니다. 최고의 탐지 시스템은 여러 접근 방식을 결합하고 이진 판정이 아닌 보정된 신뢰도 추정치를 제공합니다.
책임있는 탐지기가 하는 일
책임 있는 AI 텍스트 감지 도구는 여러 가지 작업을 수행합니다. 바이너리 플래그뿐만 아니라 관련 신뢰도 수준과 함께 점수를 보고합니다. 점수에 가장 크게 기여한 특정 구절을 강조하여 대상 검토가 가능합니다. 알려진 오류 모드를 인식하고 이를 사용자에게 전달합니다. 그리고 결과적인 결정에 대해서는 사람의 검토를 권장합니다. SUS IT의 문서 분석은 어떤 패턴이 탐지 결과를 유발했는지 설명하는 근거 텍스트를 제공하므로 사용자는 단순히 숫자를 받아들이는 것이 아니라 추론을 평가할 수 있습니다. 설명 없는 탐지는 오용을 부르는 블랙박스입니다.
탐지 결과로 수행할 작업
자신이 작성한 텍스트에 대해 높은 AI 가능성 점수를 받은 경우 다음 단계는 대상 수정입니다. 즉, 더 많은 개인적인 관점을 추가하고, 문장 길이의 변형을 늘리고, 더 많은 도메인별 언어와 자신의 경험에서 얻은 구체적인 예를 사용합니다. 감지기를 통해 수정된 텍스트를 다시 실행하면 어떤 변경 사항이 AI 출력과의 통계적 유사성을 감소시켰는지 확인할 수 있습니다. 다른 사람으로부터 플래그가 지정된 콘텐츠를 받는 교육자 또는 편집자라면 점수를 평결이 아닌 대화를 위한 메시지로 취급하세요. 결론을 내리기 전에 저자에게 프로세스에 대해 물어보고, 표시된 부분을 검토하고, 추가 증거를 찾으세요.