Kryminalistyka muzyczna i dźwiękowa
Modele klonowania muzyki i głosu oparte na sztucznej inteligencji działają na zasadzie przewidywania kształtów fal dźwiękowych na podstawie ogromnych zbiorów danych. Choć stają się niezwykle przekonujące dla ludzkiego ucha, często pozostawiają po sobie mikroskopijne „cyfrowe odciski palców” w widmie częstotliwości, które SUS IT ma wykrywać.
Jak to wykrywamy:
- Odcięcia wysokiej częstotliwości: Wiele modeli sztucznej inteligencji ma trudności z generowaniem spójnych danych powyżej 16 kHz–20 kHz, tworząc nienaturalną twardą półkę lub „pustkę” w spektrogramie, która rzadko występuje w naturalnych nagraniach.
- Niespójność fazowa: Naturalny dźwięk ma fizyczny związek między częstotliwościami. Generowanie sztucznej inteligencji często traktuje częstotliwości matematycznie, ale ignoruje ich wyrównanie fazowe, co prowadzi do subtelnej „metalicznej” lub „rozmazanej” jakości, znanej jako artefakty wokodera fazowego.
- Przejściowe rozmazywanie: Początkowy atak dźwięku (takiego jak werbel lub spółgłoska „t”) jest ostry i zdefiniowany w prawdziwym dźwięku. W przypadku generacji AI te stany nieustalone są często bardziej miękkie lub „bardziej papkowate” ze względu na proces dyfuzji.