音楽とオーディオのフォレンジック
AI 音楽および音声クローン モデルは、膨大なデータセットに基づいてオーディオ波形を予測することによって機能します。それらは人間の耳に信じられないほど説得力のあるものになりつつありますが、しばしば SUS IT が検出するように設計された周波数スペクトル内に微細な「デジタル指紋」を残します。
検出方法:
- 高周波カットオフ: 多くの AI モデルは、16kHz ~ 20kHz を超える一貫したデータを生成するのに苦労しており、自然録音ではめったに存在しない不自然なハードシェルフまたは「ボイド」をスペクトログラムに作成します。
- 位相インコヒーレンス: 自然音には周波数間に物理的な関係があります。 AI 生成では、多くの場合、周波数は数学的に処理されますが、その位相調整は無視され、位相ボコーダー アーティファクトとして知られる微妙な「金属的」または「不鮮明な」品質が生じます。
- 一時的なスミアリング: 実際のオーディオでは、サウンドの最初のアタック (スネアドラムや子音「t」など) がシャープで明確です。 AI 生成では、拡散プロセスにより、これらのトランジェントはより柔らかく、または「より鈍い」ことがよくあります。