Análise forense de música e áudio
Os modelos de clonagem de música e voz de IA operam prevendo formas de onda de áudio com base em vastos conjuntos de dados. Embora estejam se tornando incrivelmente convincentes para o ouvido humano, muitas vezes deixam para trás "impressões digitais" microscópicas no espectro de frequência que o SUS IT foi projetado para detectar.
Como detectamos isso:
- Cortes de alta frequência: Muitos modelos de IA lutam para gerar dados consistentes acima de 16kHz-20kHz, criando uma prateleira rígida ou "vazio" não natural no espectrograma que raramente existe em gravações naturais.
- Incoerência de fase: O som natural tem uma relação física entre frequências. A geração de IA muitas vezes trata as frequências matematicamente, mas ignora seu alinhamento de fase, levando a uma qualidade sutil “metálica” ou “manchada”, conhecida como artefatos de vocoder de fase.
- Manchas transitórias: O ataque inicial de um som (como uma caixa ou uma consoante 't') é nítido e definido em áudio real. Na geração de IA, esses transientes são frequentemente mais suaves ou "mais pastosos" devido ao processo de difusão.