音乐与音频取证
AI 音乐与声音克隆模型通过基于海量数据集预测音频波形来运作。尽管它们在人耳听来已变得极具说服力,但通常会在频率频谱中留下细微的“数字指纹”,而这正是 SUS IT 专门设计用来检测的对象。
我们的检测方法:
- 高频截止: 许多 AI 模型难以在 16kHz-20kHz 以上生成一致的数据,从而在频谱图中形成不自然的硬性截断或“空白”,这在自然录音中极为罕见。
- 相位不相干: 自然声音的各频率之间存在物理关系。AI 生成通常以数学方式处理频率,却忽略了它们的相位对齐,从而导致一种细微的“金属感”或“涂抹感”,即所谓的相位声码器伪影。
- 瞬态涂抹: 真实音频中声音的起始瞬态(如军鼓敲击或辅音“t”)清晰而明确。而在 AI 生成的音频中,由于扩散过程的影响,这些瞬态往往显得更柔和或“模糊”。