AI 탐지기가 MP3 파일에서 오탐지를 얻는 이유
팀 · SUS IT 편집팀
Tim은 탐지 방법론에 중점을 둔 소프트웨어 엔지니어이자 AI 연구원입니다.
MP3 압축이 AI 세대 서명을 모방하는 아티팩트를 생성하는 방법과 이에 대해 수행할 수 있는 작업에 대한 기술 설명입니다.
AI 탐지기를 통해 MP3 파일을 실행하고 사람이 만든 트랙에 대해 의심스러울 정도로 높은 AI 점수를 받았다면 혼자가 아닙니다. 이는 AI 오디오 감지에서 가장 일반적인 문제 중 하나이며 MP3 압축 작동 방식과 관련이 있습니다.
MP3 압축 작동 방식
MP3는 "손실이 있는" 압축 형식입니다. 즉, 파일 크기를 줄이기 위해 오디오 데이터를 영구적으로 삭제합니다. 특히, 심리음향 모델을 사용하여 인간의 귀가 인지하기 어려운 주파수를 식별하고 이를 제거합니다. 가장 중요한 효과는 MP3 인코딩이 고주파수(일반적으로 표준 비트 전송률에서 16kHz를 초과하는 모든 주파수)를 차단하고 나머지 주파수 데이터를 평활화한다는 것입니다.
이것이 AI처럼 보이는 이유
문제는 다음과 같습니다. 초기 AI 음악 생성기는 매우 유사한 특성을 가진 오디오를 생성했습니다. AI 음악을 생성하는 신경망은 고주파수가 잘리고 부자연스럽게 부드러운 스펙트럼 프로필을 사용하여 출력을 생성하는 경향이 있습니다. 따라서 AI 탐지기가 MP3 파일을 검사할 때 압축 아티팩트는 AI 생성 아티팩트와 수학적으로 동일하게 보입니다. 탐지기는 "압축됨"과 "생성됨"을 구별할 수 없습니다.
스펙트럼 번짐 효과
MP3 압축은 오디오 엔지니어가 "스펙트럼 스미어링(spectral smearing)"이라고 부르는 현상을 유발합니다. 즉, 원본 녹음에서 선명하고 뚜렷한 주파수가 흐려지고 혼합됩니다. 이 번짐은 스펙트로그램에서 부드러운 그라데이션으로 나타나며, 이는 AI 탐지기가 플래그를 지정하도록 훈련된 패턴과 정확히 같습니다. 압축률이 높을수록(비트 전송률이 낮을수록) 이 효과는 더욱 두드러집니다.
이에 대해 당신이 할 수 있는 일
가장 간단한 해결책은 비압축 또는 무손실 압축 오디오 형식을 사용하는 것입니다. WAV 및 FLAC 파일은 원본 오디오 데이터를 손실 없이 보존하므로 AI 탐지기에 작업할 수 있는 전체 그림을 제공합니다. 검증을 위해 작품을 제출하는 음악가라면 항상 압축된 MP3보다는 DAW에서 내보낸 원본 WAV 또는 FLAC를 사용하세요.
MP3가 당신의 전부일 때
MP3만 있는 경우도 있습니다. 스트리밍 플랫폼의 트랙이거나 누군가가 보낸 파일일 수도 있습니다. 이러한 경우 좋은 AI 감지기는 분석 시 압축 아티팩트를 고려해야 합니다. SUS IT의 향상된 MP3 디코딩 파이프라인은 MP3 파일에서 PCM 오디오 데이터를 추출하고 압축 특성을 분석 모델에 적용하여 순진한 접근 방식에 비해 오탐지를 크게 줄입니다.
비트레이트 문제
모든 MP3가 동일하게 생성되는 것은 아닙니다. 320kbps MP3는 128kbps 파일보다 훨씬 더 많은 원본 오디오 데이터를 유지합니다. 비트 전송률이 높은 MP3는 압축 아티팩트가 더 적고 잘못된 긍정을 유발할 가능성이 적습니다. MP3를 사용해야 하는 경우 사용 가능한 가장 높은 비트 전송률을 사용하십시오. 128kbps와 320kbps MP3 사이의 감지 정확도 차이는 상당할 수 있습니다.
핵심 정리
MP3 파일의 오탐지는 특정 도구의 결함이 아니라 오디오 AI 감지의 알려진 제한 사항입니다. 이는 압축 아티팩트와 AI 생성 아티팩트 간의 근본적인 유사성에서 발생합니다. 가장 좋은 방법은 가능할 때마다 압축되지 않은 파일을 분석하는 것입니다. MP3로 작업할 때는 비트 전송률이 높은 파일을 사용하고 압축 오디오 형식을 특별히 처리하는 SUS IT와 같은 감지기를 선택하세요.