Forensique musicale et audio
Les modèles d’IA de clonage de musique et de voix fonctionnent en prédisant les formes d’onde audio sur la base de vastes ensembles de données. Bien qu'ils deviennent incroyablement convaincants pour l'oreille humaine, ils laissent souvent derrière eux des « empreintes digitales » microscopiques dans le spectre de fréquences que SUS IT est conçu pour détecter.
Comment nous le détectons :
- Coupures haute fréquence : De nombreux modèles d'IA ont du mal à générer des données cohérentes au-dessus de 16 kHz à 20 kHz, créant ainsi une étagère dure non naturelle ou un « vide » dans le spectrogramme qui existe rarement dans les enregistrements naturels.
- Incohérence de phase : Le son naturel a une relation physique entre les fréquences. La génération d'IA traite souvent les fréquences de manière mathématique mais ignore leur alignement de phase, ce qui conduit à une subtile qualité « métallique » ou « maculée » connue sous le nom d'artefacts du vocodeur de phase.
- Masquage transitoire : L'attaque initiale d'un son (comme une caisse claire ou une consonne « t ») est nette et définie dans l'audio réel. Dans la génération IA, ces transitoires sont souvent plus doux ou « plus doux » en raison du processus de diffusion.