Почему AI-детекторы выдают ложные срабатывания на MP3-файлах
SUS IT
Технический разбор того, как сжатие MP3 создаёт артефакты, имитирующие признаки AI-генерации, и что с этим можно сделать.
Если вы хоть раз пропускали MP3-файл через AI-детектор и получали подозрительно высокий AI-показатель для трека, который точно создан человеком, — вы не одиноки. Это одна из самых распространённых проблем в аудио-детекции AI, и она напрямую связана с тем, как работает сжатие MP3.
Как работает сжатие MP3
MP3 — это формат сжатия «с потерями», то есть он безвозвратно отбрасывает часть аудиоданных ради уменьшения размера файла. В частности, он использует психоакустическую модель, чтобы определить частоты, которые человеческое ухо вряд ли заметит, и удаляет их. Наиболее существенный эффект — кодирование MP3 обрезает высокие частоты (как правило, всё выше 16 кГц при стандартных битрейтах) и сглаживает оставшиеся частотные данные.
Почему это похоже на AI
В этом и заключается проблема: ранние AI-генераторы музыки создавали звук с очень похожими характеристиками. Нейросети, генерирующие AI-музыку, также склонны выдавать результат с урезанными высокими частотами и неестественно гладким спектральным профилем. Поэтому когда AI-детектор анализирует MP3-файл, артефакты сжатия математически выглядят идентично артефактам AI-генерации. Детектор не может отличить «это было сжато» от «это было сгенерировано».
Эффект спектрального смазывания
Сжатие MP3 вызывает то, что звукоинженеры называют «спектральным смазыванием» — частоты, которые в оригинальной записи были чёткими и различимыми, становятся размытыми и сливаются друг с другом. Это смазывание проявляется в спектрограмме как плавные градиенты — именно тот тип паттерна, на который обучены реагировать AI-детекторы. Чем сильнее сжатие (ниже битрейт), тем выраженнее этот эффект.
Что можно с этим сделать
Самое простое решение — использовать несжатые или сжатые без потерь аудиоформаты. Файлы WAV и FLAC сохраняют оригинальные аудиоданные без потерь, давая AI-детекторам полную картину для анализа. Если вы музыкант, отправляющий свою работу на верификацию, всегда используйте оригинальный экспорт WAV или FLAC из вашей DAW, а не сжатый MP3.
Когда есть только MP3
Иногда под рукой есть только MP3 — например, трек со стриминговой платформы или файл, присланный кем-то другим. В таких случаях хороший AI-детектор должен учитывать артефакты сжатия при анализе. Усовершенствованный конвейер декодирования MP3 в SUS IT извлекает из MP3-файлов PCM-аудиоданные и учитывает характеристики сжатия в модели анализа, значительно снижая число ложных срабатываний по сравнению с наивными подходами.
Битрейт имеет значение
Не все MP3 одинаковы. MP3 с битрейтом 320 кбит/с сохраняет гораздо больше исходных аудиоданных, чем файл на 128 кбит/с. MP3 с более высоким битрейтом создаёт меньше артефактов сжатия и реже провоцирует ложные срабатывания. Если приходится использовать MP3, выбирайте максимально доступный битрейт. Разница в точности детекции между MP3 на 128 и 320 кбит/с может быть существенной.
Итог
Ложные срабатывания на MP3-файлах — известное ограничение аудио-детекции AI, а не изъян какого-то конкретного инструмента. Они возникают из-за фундаментального сходства между артефактами сжатия и артефактами AI-генерации. Лучшая практика — анализировать несжатые файлы, когда это возможно. При работе с MP3 используйте файлы с высоким битрейтом и выбирайте детектор вроде SUS IT, который специально обрабатывает сжатые аудиоформаты.