← Назад к блогу
Текст30 марта 2026 г.Обновлено май 2026 г.7 минут чтения

Как работают детекторы AI-эссе (и почему они не идеальны)

S

SUS IT

Статистические методы, лежащие в основе распознавания AI-текста — перплексия, «взрывчатость» и почему даже лучшие детекторы дают ложные срабатывания на текстах человека.

Детекторы AI-текста стали стандартной частью образовательных и редакционных процессов. Инструменты проверяют работы студентов на признаки ChatGPT и Gemini, издатели проверяют рукописи на наличие фрагментов, написанных AI, а платформы отсеивают спам, сгенерированный AI. Но как на самом деле работают эти системы и почему они иногда помечают текст человека как написанный AI? Понимание механики помогает использовать эти инструменты правильно и не воспринимать вероятностную оценку как окончательный вердикт.

Основная проблема: текст — это просто статистика

Естественный язык по своей сути — статистическое явление. Каждый выбор слова, структура предложения и ритм абзаца отражают паттерны, усвоенные из чтения и опыта. Языковые модели AI обучаются на огромных объёмах текста, написанного людьми, а значит, учатся производить статистически правдоподобный человеческий язык — что, к сожалению, как раз и затрудняет их распознавание. Задача систем детекции — найти тонкие статистические различия между текстом, написанным человеком, и текстом, созданным AI, которые сохраняются в разных темах, стилях и контекстах.

Перплексия: насколько предсказуемо каждое слово?

Наиболее широко используемая метрика в распознавании AI-текста — перплексия, мера того, насколько языковая модель «удивлена» каждым словом с учётом предшествующего контекста. Текст человека тяготеет к более высокой перплексии: мы делаем неожиданные выборы слов, вводим новые идеи, используем идиомы или профессиональный жаргон особым образом и идём на лингвистические «риски», которым статистическая модель присвоила бы низкую вероятность. Текст, созданный AI, будучи результатом работы системы, обученной максимизировать правдоподобие, тяготеет к более низкой перплексии: выбор слов, уместных по контексту, распространённых и предсказуемых. Устойчивый фрагмент текста с низкой перплексией — сигнал того, что его могла создать языковая модель.

«Взрывчатость»: насколько сильно меняется сложность?

Второй важный сигнал — «взрывчатость» (burstiness): вариативность длины предложений, структуры и сложности внутри фрагмента текста. Человеческий текст естественным образом «взрывается»: длинное сложное предложение сменяется коротким, плотный технический абзац сменяется аналогией, формальное утверждение — неформальной репликой. Языковые модели AI тяготеют к постоянной сложности — каждое предложение генерируется в некоторой степени независимо, с похожей глубиной и структурой, что создаёт текст, который течёт гладко, но лишён неровного, «человеческого» качества естественной мысли. Системы детекции измеряют статистическую дисперсию этих свойств по всему тексту.

Почему эти метрики не безупречны

Проблема перплексии и «взрывчатости» как сигналов детекции в том, что это свойства текста, а не авторства. Формальный академический текст — именно тот вид письма, который требуют от студентов, — по замыслу тяготеет к низкой перплексии и низкой «взрывчатости». Инженерный отчёт, юридическое заключение или раздел научной методологии должны быть ясными, предсказуемыми и последовательно структурированными. Это признаки хорошего формального письма, а не AI-генерации. Многоязычные авторы, которые могут не использовать весь идиоматический диапазон своего второго языка, также склонны создавать более статистически предсказуемый текст. Ложные срабатывания — не признак того, что детектор сломан, а неизбежное следствие применения статистических измерений в области, где статистика закономерно пересекается.

Проблема обучающих данных

Детекторы AI-текста обучаются на наборах данных с известными текстами человека и AI. Качество и разнообразие этих наборов данных принципиально ограничивают точность детекции. Детектор, обученный преимущественно на выводах ChatGPT 3.5, может плохо обобщаться на выводы Claude 3.5 или GPT-4o, у которых другие статистические свойства. Детектор, обученный на английском тексте, может плохо работать для других языков. Детекторам приходится постоянно переобучаться на выводах новых моделей, чтобы сохранять точность по мере совершенствования генеративных моделей, и всегда существует задержка между выходом новой модели и способностью детектора надёжно распознавать её вывод.

Детекция с нулевым обучением против дообученной детекции

Некоторые системы детекции используют подход «с нулевым обучением» (zero-shot): они применяют предварительно обученную языковую модель напрямую для оценки перплексии без специализированного обучения под конкретную задачу. Другие дообучают классификатор специально для распознавания AI, используя размеченные примеры. Методы с нулевым обучением, как правило, более прозрачны (можно точно понять, что именно они измеряют), но менее точны. Дообученные классификаторы могут достигать более высокой точности на своём обучающем распределении, но склонны переобучаться под конкретные семейства моделей. Лучшие системы детекции сочетают несколько подходов и выдают откалиброванные оценки достоверности, а не бинарные вердикты.

Что делает ответственный детектор

Ответственный инструмент распознавания AI-текста делает несколько вещей: сообщает оценку с соответствующим уровнем достоверности, а не просто бинарную метку; выделяет конкретные фрагменты, внёсшие наибольший вклад в оценку, позволяя провести прицельную проверку; признаёт известные случаи ошибок и сообщает о них пользователям; и рекомендует человеческую проверку для любого решения с серьёзными последствиями. Анализ документов SUS IT предоставляет пояснительный текст, объясняющий, какие паттерны вызвали результат детекции, чтобы пользователи могли оценить логику, а не просто принять число на веру. Детекция без объяснения — это чёрный ящик, который провоцирует злоупотребления.

Что делать с результатом детекции

Если вы получили высокий показатель вероятности AI на тексте, который точно написали сами, следующий шаг — целенаправленная переработка: добавьте больше личной точки зрения, увеличьте вариативность длины предложений, используйте больше специализированной лексики и конкретных примеров из собственного опыта. Повторная проверка отредактированного текста детектором позволит увидеть, какие изменения снизили статистическое сходство с выводом AI. Если вы преподаватель или редактор, получивший помеченный контент от другого человека, относитесь к оценке как к поводу для разговора, а не к вердикту. Спросите автора о процессе работы, изучите помеченные фрагменты и поищите дополнительные доказательства, прежде чем делать выводы.

Похожие статьи

Попробуйте SUS IT бесплатно

Зарегистрируйтесь и получите 1 бесплатный скан для проверки любого файла или ссылки на признаки AI-генерации.

Начать бесплатно