Deepfake 법의학 설명: 비디오 AI 탐지가 실제로 작동하는 방식
매트 · SUS IT 편집팀
Matt는 비디오 포렌식 및 전산 미디어 분석을 전문으로 합니다.
포렌식 도구가 GAN 아티팩트부터 시간적 일관성 분석까지 AI가 생성하고 조작한 비디오를 감지하는 방법에 대한 기술적 분석입니다.
딥페이크 비디오를 탐지하는 것은 AI가 생성한 이미지나 오디오를 탐지하는 것보다 훨씬 더 복잡합니다. 비디오는 시간 차원을 추가하기 때문입니다. 각 프레임을 개별적으로 분석해야 할 뿐만 아니라 프레임 간의 관계를 일관성 있게 평가해야 합니다. 실제 비디오에서 조작된 단일 프레임은 완전히 합성된 클립과 매우 다른 흔적을 남깁니다. 법의학 비디오 분석이 실제로 무엇을 하는지 이해하면 그 기능과 한계가 모두 드러납니다.
가짜 비디오의 두 가지 범주
탐지 방법을 살펴보기 전에 조작된 비디오의 두 가지 주요 범주를 구별하는 것이 좋습니다. 첫 번째는 얼굴 교체 또는 얼굴 교환입니다. 즉, 실제 비디오 영상을 촬영하고 한 사람의 얼굴을 다른 사람의 얼굴로 바꾸는 것입니다. 이는 딥페이크의 원래 형태였으며 여전히 널리 퍼져 있습니다. 두 번째는 완전 합성입니다. Sora, Kling 또는 Runway와 같은 모델을 사용하여 원본 영상을 기반으로 하지 않고 완전히 처음부터 비디오 콘텐츠를 생성합니다. 이 두 가지 범주는 서로 다른 법의학적 흔적을 남기며 다소 다른 탐지 접근 방식이 필요합니다.
프레임 수준 분석: GAN 아티팩트
많은 딥페이크 얼굴 교환 기술을 뒷받침하는 생성적 적대 신경망(GAN)은 프레임 수준에서 특징적인 아티팩트를 생성합니다. GAN의 판별자는 생성기가 비현실적인 출력을 생성하는 것을 방지하도록 훈련되지만 훈련 프로세스는 특정 지문을 남기는 일종의 평형을 생성합니다. 여기에는 매끄러워야 하는 영역(특히 하늘이나 피부와 같이 균일한 색상 영역)의 구조화된 노이즈가 포함됩니다. 카메라 광학과 다른 고주파 디테일이 렌더링되는 방식의 특징적인 패턴; 합성 과정에서 발생하는 얼굴 영역의 특정 색상 분포 이상 등이 있습니다.
시간적 일관성: 비디오 관련 텔
비디오에서 가장 강력한 포렌식 신호는 시간적 불일치, 즉 콘텐츠가 한 프레임에서 다음 프레임으로 자연스럽게 흐르지 않는 곳입니다. 실제 비디오 영상은 일관된 모션 블러, 일관된 센서 노이즈, 일관된 조명 변화를 통해 일관된 프레임 속도로 촬영됩니다. 얼굴이 신경망에 의해 프레임별로 교체되면 시간이 지남에 따라 미묘한 불일치가 누적됩니다. 합성 얼굴은 주변 비디오와 약간 다른 노이즈 특성을 나타낼 수 있고, 프레임 간에 조명이 정확하게 업데이트되지 않을 수 있으며, 합성 얼굴과 실제 배경 사이의 경계가 미묘하지만 통계적으로 변칙적인 방식으로 깜박일 수 있습니다.
안구 운동 및 깜박임 분석
인간의 눈 움직임에는 구체적이고 예측 가능한 패턴이 있습니다. 단속운동(빠른 안구 운동)은 특징적인 궤적과 지속 시간을 따릅니다. 미세 단속적 움직임(작은 비자발적 눈 움직임)은 실제 영상에 특정 속도로 나타납니다. 깜박임 시간과 빈도는 불규칙하지만 정상 범위 내에 있습니다. 많은 딥페이크 모델은 너무 가만히 있거나, 단속 운동 중에 부자연스러운 궤적을 따르거나, 의심스러울 만큼 규칙적인 간격으로 깜박이는 눈을 생성하는 등 설득력 있는 눈 움직임을 합성하는 데 어려움을 겪고 있습니다. 눈 행동에 대한 프레임별 분석은 얼굴 교환 딥페이크에 대한 보다 식별력 있는 테스트 중 하나입니다.
장면 전반에 걸친 조명 일관성
실제 비디오의 조명은 전체 프레임에 걸쳐 지속적이고 일관되게 변경됩니다. 광원이 이동하거나 밝아지거나 색온도가 변경되면 장면의 모든 표면이 형상 및 반사율에 따라 영향을 받습니다. Deepfake 얼굴 교체는 때때로 장면을 기준으로 합성 얼굴의 조명을 올바르게 업데이트하지 못하여 주변 환경과 미묘하게 다른 조명 조건에 존재하는 것처럼 보이는 얼굴을 생성합니다. 이는 콘서트, 움직이는 차량, 깜박이는 화면 등 역동적인 조명이 있는 장면에서 가장 눈에 띄게 나타납니다. 이러한 장면에서는 조명이 빠르게 변하고 딥페이크 모델이 속도를 따라갈 수 없습니다.
시청각 동기화
딥페이크 비디오에 음성이 포함된 경우 입술 움직임과 오디오 간의 동기화는 중요한 법의학 신호입니다. 실제 음성에는 호흡, 성대 진동 및 조음 간의 정확한 조정이 포함됩니다. Deepfake 합성은 오디오와 비디오를 동시에 생성하거나 별도로 생성된 구성 요소를 정렬해야 합니다. 두 접근 방식 모두 미묘한 비동기화를 생성할 수 있습니다. 법의학 분석은 오디오 이벤트(특히 음향 버스트를 생성하는 "p", "b", "t" 및 "k"와 같은 정지 자음)와 해당 시각적 표현 이벤트 간의 밀리초 수준 타이밍 관계를 측정합니다.
압축 아티팩트 분석
비디오 압축(H.264, H.265, VP9)은 전체 프레임 데이터가 아닌 프레임 간의 차이를 저장하는 방식으로 작동합니다. 압축 알고리즘은 픽셀이 프레임마다 어떻게 변할지 예측하고 예측 오류만 저장합니다. 얼굴이 합성적으로 대체되면 대체 경계 주변 영역은 주변 원본 영상과 압축 시 다르게 동작합니다. 압축 예측 오류는 원본 영상보다 딥페이크된 영역에서 더 크고 구조화됩니다. 이 압축 영역 분석은 시각적 품질이 인간 관찰자를 속일 만큼 충분히 높은 경우에도 조작을 감지할 수 있습니다.
완전 합성 비디오
Sora 또는 Kling과 같은 도구에서 완전 합성 비디오를 감지하는 것은 어떤 면에서는 얼굴 교환을 감지하는 것보다 쉽고 다른 면에서는 어렵습니다. 완전 합성 비디오에는 실제 콘텐츠와 합성 콘텐츠를 합성하여 발생하는 불일치가 없지만 확산 기반 비디오 모델의 특징적인 생성 아티팩트, 즉 약간 특이한 객체 물리학(물, 불, 천이 대략적으로 정확하지만 물리적으로 정확하지는 않은 방식으로 이동), 컷 간 연속성을 유지하지 않는 배경 요소, 각 세대 시스템의 훈련에 특정한 미묘하지만 널리 퍼져 있는 텍스처 특성을 나타냅니다.
실질적인 의미
언론인, 법률 전문가, 콘텐츠 조정자, 보안 연구원 등 비디오 증거를 평가하는 모든 사람에게 있어 핵심 실무적 요점은 단일 포렌식 신호만으로는 충분하지 않다는 것입니다. 가장 신뢰할 수 있는 탐지는 프레임 수준 아티팩트 분석, 시간 일관성 채점, 안구 운동 분석, 시청각 동기화 측정 및 압축 아티팩트 검사 등 여러 가지 독립적인 분석 방법을 결합합니다. SUS IT의 비디오 분석 파이프라인은 이러한 다차원적 접근 방식을 적용하여 클립 전체 기간에 걸쳐 개별 프레임과 시간 패턴을 모두 검사합니다. 결과는 단일 테스트가 아닌 여러 독립 신호의 수렴을 반영하는 신뢰도 가중치 판정입니다.