Музыкальная и аудиофорензика
Модели клонирования AI-музыки и голоса работают, предсказывая аудиоволны на основе огромных наборов данных. Хотя они становятся невероятно убедительными для человеческого слуха, они часто оставляют микроскопические «цифровые отпечатки» в частотном спектре, которые SUS IT умеет обнаруживать.
Как мы это обнаруживаем:
- Обрезка высоких частот: Многие AI-модели не справляются с генерацией стабильных данных выше 16–20 кГц, создавая неестественный резкий обрыв или «пустоту» в спектрограмме, которая редко встречается в естественных записях.
- Фазовая некогерентность: У натурального звука есть физическая взаимосвязь между частотами. AI-генерация часто обрабатывает частоты математически, но игнорирует их фазовое выравнивание, что приводит к едва уловимому «металлическому» или «размытому» звучанию, известному как артефакты фазового вокодера.
- Размытие переходных процессов: Начальная атака звука (например, удар малого барабана или согласная «т») в реальном аудио резкая и чёткая. При AI-генерации эти переходные процессы часто оказываются мягче или «смазаннее» из-за диффузионного процесса.