Análisis forense de música y audio
Los modelos de clonación de voz y música de IA funcionan prediciendo formas de onda de audio basadas en vastos conjuntos de datos. Si bien se están volviendo increíblemente convincentes para el oído humano, a menudo dejan "huellas digitales" microscópicas en el espectro de frecuencia que SUS IT está diseñado para detectar.
Cómo lo detectamos:
- Cortes de alta frecuencia: Muchos modelos de IA tienen dificultades para generar datos consistentes por encima de 16 kHz-20 kHz, lo que crea un estante rígido antinatural o un "vacío" en el espectrograma que rara vez existe en las grabaciones naturales.
- Incoherencia de fase: El sonido natural tiene una relación física entre frecuencias. La generación de IA a menudo trata las frecuencias matemáticamente pero ignora su alineación de fase, lo que lleva a una sutil calidad "metálica" o "manchada" conocida como artefactos de vocodificador de fase.
- Manchas transitorias: El ataque inicial de un sonido (como un tambor o una consonante 't') es agudo y definido en audio real. En la generación de IA, estos transitorios suelen ser más suaves o "más blandos" debido al proceso de difusión.