Криминалистика дипфейков: как на самом деле работает распознавание AI на видео
SUS IT
Технический разбор того, как криминалистические инструменты распознают созданное AI и манипулированное видео — от артефактов GAN до анализа временной согласованности.
Распознавание дипфейк-видео значительно сложнее, чем распознавание изображений или аудио, созданных AI, потому что видео добавляет временное измерение — необходимо анализировать не только каждый кадр по отдельности, но и оценивать согласованность отношений между кадрами. Один манипулированный кадр в остальном подлинном видео оставляет совершенно иные следы, чем полностью синтетический клип. Понимание того, что на самом деле делает криминалистический анализ видео, проясняет как его возможности, так и его ограничения.
Две категории фальшивого видео
Прежде чем углубляться в методы детекции, стоит разграничить две основные категории манипулированного видео. Первая — замена лица (face swap): взятие подлинных видеозаписей и замена лица одного человека лицом другого. Это была первоначальная форма дипфейков, и она по-прежнему распространена. Вторая — полный синтез: генерация видеоконтента полностью с нуля с помощью моделей вроде Sora, Kling или Runway, без оригинальной съёмки в качестве основы. Эти две категории оставляют разные криминалистические следы и требуют несколько разных подходов к детекции.
Анализ на уровне кадра: артефакты GAN
Генеративно-состязательные сети (GAN), лежащие в основе многих техник дипфейк-замены лица, создают характерные артефакты на уровне кадра. Дискриминатор GAN обучен не допускать создания генератором нереалистичного результата, но сам процесс обучения создаёт своего рода равновесие, оставляющее специфические отпечатки. Среди них: структурированный шум в областях, которые должны быть гладкими (особенно на участках однородного цвета, таких как небо или кожа); характерные паттерны в воспроизведении высокочастотных деталей, отличающиеся от оптики камеры; и специфические аномалии в распределении цвета в области лица, возникающие в результате процесса компоновки.
Временная согласованность: признак, специфичный для видео
Самый мощный криминалистический сигнал в видео — временная несогласованность: места, где содержание не перетекает естественно из одного кадра в другой. Настоящая видеозапись снимается с постоянной частотой кадров, с постоянным размытием в движении, постоянным шумом сенсора и постоянными изменениями освещения. Когда лицо заменяется покадрово нейросетью, замена вносит тонкие несоответствия, которые накапливаются со временем. Синтетическое лицо может иметь чуть иные шумовые характеристики, чем окружающее видео, освещение может не обновляться корректно между кадрами, а границы между синтетическим лицом и настоящим фоном могут мерцать способом, который едва заметен, но статистически аномален.
Анализ движения глаз и моргания
Движение глаз человека имеет специфические, предсказуемые паттерны. Саккады (быстрые движения глаз) следуют характерным траекториям и длительностям. Микросаккады (крошечные непроизвольные движения глаз) присутствуют в настоящей съёмке с определённой частотой. Продолжительность и частота моргания нерегулярны, но находятся в пределах нормального диапазона. Многие модели дипфейков испытывают трудности с убедительным синтезом движения глаз, создавая либо слишком неподвижные глаза, либо глаза, следующие по неестественным траекториям во время саккад, либо моргающие с подозрительно регулярными интервалами. Покадровый анализ поведения глаз — один из наиболее различающих тестов для дипфейков с заменой лица.
Согласованность освещения по всей сцене
Освещение в настоящем видео меняется непрерывно и согласованно по всему кадру. Если источник света движется, становится ярче или меняет цветовую температуру, это затрагивает каждую поверхность в сцене в соответствии с её геометрией и отражательной способностью. Дипфейк-замены лица иногда не успевают корректно обновить освещение синтетического лица относительно сцены, в результате чего лицо словно существует в чуть иных условиях освещения, чем окружающая обстановка. Это наиболее заметно в сценах с динамичным освещением — на концертах, в движущихся автомобилях, при мерцающих экранах, — где освещение меняется быстро, и модель дипфейка не успевает за ним.
Аудиовизуальная синхронизация
Когда дипфейк-видео включает речь, синхронизация между движением губ и звуком становится важным криминалистическим сигналом. Настоящая речь требует точной координации между дыханием, вибрацией голосовых связок и артикуляцией. Синтез дипфейков должен либо генерировать аудио и видео одновременно, либо совмещать отдельно сгенерированные компоненты — оба подхода могут приводить к тонкой рассинхронизации. Криминалистический анализ измеряет временные соотношения на уровне миллисекунд между звуковыми событиями (особенно взрывными согласными вроде «п», «б», «т» и «к», создающими акустические всплески) и соответствующими им визуальными артикуляционными событиями.
Анализ артефактов сжатия
Сжатие видео (H.264, H.265, VP9) работает, сохраняя различия между кадрами, а не полные данные каждого кадра. Алгоритм сжатия делает предсказания о том, как изменятся пиксели от кадра к кадру, и сохраняет только ошибки предсказания. Когда лицо было синтетически заменено, область вокруг границы замены ведёт себя иначе при сжатии, чем окружающая оригинальная съёмка — ошибки предсказания сжатия крупнее и более структурированы в дипфейк-области, чем в оригинальном видео. Такой анализ в области сжатия способен выявлять манипуляции, даже когда визуальное качество достаточно высокое, чтобы обмануть человеческий глаз.
Полностью синтетическое видео
Распознавание полностью синтетического видео из таких инструментов, как Sora или Kling, в некотором смысле проще, а в некотором сложнее, чем распознавание замены лица. Полностью синтетическое видео не имеет несоответствий, возникающих при совмещении настоящего и синтетического контента, но демонстрирует характерные артефакты генерации диффузионных видеомоделей: слегка необычную физику объектов (вода, огонь и ткань движутся приблизительно правильно, но не физически точно), элементы фона, не сохраняющие непрерывность между склейками, и тонкие, но постоянные текстурные особенности, специфичные для обучения конкретной генеративной системы.
Практические выводы
Для каждого, кто оценивает видеодоказательства — журналистов, юристов, модераторов контента или исследователей в сфере безопасности, — ключевой практический момент состоит в том, что ни один отдельный криминалистический сигнал не является достаточным сам по себе. Наиболее надёжное распознавание сочетает несколько независимых методов анализа: анализ артефактов на уровне кадра, оценку временной согласованности, анализ движения глаз, измерение аудиовизуальной синхронизации и изучение артефактов сжатия. Конвейер анализа видео SUS IT применяет этот многомерный подход, изучая как отдельные кадры, так и временные паттерны на протяжении всего клипа. Результатом становится вердикт, взвешенный по уровню достоверности, отражающий совпадение нескольких независимых сигналов, а не результат какого-то одного теста.