← Volver al blog
Video20 de abril de 2026Actualizado mayo de 20268 minutos de lectura

Explicación de la ciencia forense de Deepfake: cómo funciona realmente la detección de vídeo por IA

M

Matt · Equipo editorial de SUS IT

Matt se especializa en video forense y análisis de medios computacionales.

Un desglose técnico de cómo las herramientas forenses detectan videos manipulados y generados por IA, desde artefactos GAN hasta análisis de coherencia temporal.

Detectar videos deepfake es sustancialmente más complejo que detectar imágenes o audio generados por IA, porque el video agrega una dimensión temporal: no solo se debe analizar cada cuadro individualmente, sino que también se deben evaluar las relaciones entre cuadros para determinar su coherencia. Un único fotograma manipulado en un vídeo auténtico deja huellas muy diferentes a las de un clip totalmente sintético. Comprender lo que realmente hace el análisis de vídeo forense ilumina tanto sus capacidades como sus limitaciones.

Las dos categorías de vídeos falsos

Antes de profundizar en los métodos de detección, vale la pena distinguir las dos categorías principales de vídeo manipulado. El primero es el reemplazo de rostros o intercambio de rostros: tomar secuencias de video genuinas y reemplazar el rostro de una persona por el de otra. Esta era la forma original de deepfake y sigue siendo común. El segundo es la síntesis completa: generar contenido de video completamente desde cero utilizando modelos como Sora, Kling o Runway, sin imágenes originales como base. Estas dos categorías dejan huellas forenses diferentes y requieren enfoques de detección algo diferentes.

Análisis a nivel de marco: artefactos GAN

Las redes generativas adversarias (GAN), que sustentan muchas técnicas de intercambio de rostros deepfake, producen artefactos característicos a nivel de fotograma. El discriminador de GAN está entrenado para evitar que el generador produzca resultados poco realistas, pero el proceso de entrenamiento crea una especie de equilibrio que deja huellas dactilares específicas. Estos incluyen: ruido estructurado en regiones que deberían ser suaves (particularmente en áreas de color uniforme como el cielo o la piel); patrones característicos en cómo se representan los detalles de alta frecuencia que difieren de la óptica de la cámara; y anomalías específicas en la distribución del color en la región de la cara que resultan del proceso de composición.

Coherencia temporal: la narración específica del vídeo

La señal forense más poderosa en video es la inconsistencia temporal: lugares donde el contenido no fluye naturalmente de un fotograma al siguiente. Las secuencias de vídeo reales se graban a una velocidad de fotogramas constante, con un desenfoque de movimiento constante, un ruido de sensor constante y cambios de iluminación constantes. Cuando una cara es reemplazada cuadro por cuadro por una red neuronal, el reemplazo introduce sutiles inconsistencias que se acumulan con el tiempo. La cara sintética puede exhibir características de ruido ligeramente diferentes a las del vídeo circundante, es posible que la iluminación no se actualice correctamente entre fotogramas y los límites entre la cara sintética y el fondo real pueden parpadear de manera sutil pero estadísticamente anómala.

Análisis del movimiento ocular y del parpadeo

El movimiento del ojo humano tiene patrones específicos y predecibles. Las sacadas (movimientos oculares rápidos) siguen trayectorias y duraciones características. Las microsacadas (pequeños movimientos oculares involuntarios) están presentes en imágenes reales a un ritmo específico. La duración y la frecuencia del parpadeo son irregulares pero están dentro de un rango normal. Muchos modelos deepfake luchan por sintetizar movimientos oculares convincentes, ya sea produciendo ojos que están demasiado quietos, que siguen trayectorias antinaturales durante los movimientos sacádicos o que parpadean a intervalos sospechosamente regulares. El análisis fotograma a fotograma del comportamiento ocular es una de las pruebas más exigentes para los deepfakes con intercambio de caras.

Consistencia de iluminación en toda la escena

La iluminación en vídeo real cambia de forma continua y consistente en todo el fotograma. Si una fuente de luz se mueve, se ilumina o cambia la temperatura de color, cada superficie de la escena se ve afectada según su geometría y reflectancia. Los reemplazos de rostros deepfake a veces no actualizan correctamente la iluminación del rostro sintético en relación con la escena, lo que produce rostros que parecen existir en condiciones de iluminación sutilmente diferentes a las del entorno circundante. Esto es más visible en escenas con iluminación dinámica (conciertos, vehículos en movimiento, pantallas parpadeantes) donde la iluminación cambia rápidamente y el modelo deepfake no puede seguir el ritmo.

Sincronización audiovisual

Cuando un vídeo deepfake incluye voz, la sincronización entre el movimiento de los labios y el audio es una señal forense importante. El habla real implica una coordinación precisa entre la respiración, la vibración de las cuerdas vocales y la articulación. La síntesis deepfake debe generar audio y video simultáneamente o alinear componentes generados por separado; ambos enfoques pueden producir una desincronización sutil. El análisis forense mide las relaciones de tiempo a nivel de milisegundos entre eventos de audio (particularmente consonantes de parada como "p", "b", "t" y "k" que producen ráfagas acústicas) y los eventos de articulación visual correspondientes.

Análisis de artefactos de compresión

La compresión de vídeo (H.264, H.265, VP9) funciona almacenando diferencias entre fotogramas en lugar de datos completos de fotogramas. El algoritmo de compresión hace predicciones sobre cómo cambiarán los píxeles de un cuadro a otro y almacena solo los errores de predicción. Cuando una cara ha sido reemplazada sintéticamente, la región alrededor del límite de reemplazo se comporta de manera diferente bajo compresión que el metraje original circundante: los errores de predicción de compresión son mayores y más estructurados en la región deepfaked que en el video original. Este análisis de dominio de compresión puede detectar manipulaciones incluso cuando la calidad visual es lo suficientemente alta como para engañar a los observadores humanos.

Vídeo totalmente sintético

Detectar vídeo totalmente sintético a partir de herramientas como Sora o Kling es en algunos aspectos más fácil y en otros más difícil que detectar intercambios de caras. El video totalmente sintético no tiene las inconsistencias introducidas al componer contenido real y sintético, pero exhibe los artefactos de generación característicos de los modelos de video basados ​​en difusión: física de objetos ligeramente inusual (el agua, el fuego y la tela se mueven de manera aproximadamente correcta pero no físicamente precisa), elementos de fondo que no mantienen la continuidad entre cortes y características de textura sutiles pero omnipresentes que son específicas del entrenamiento de cada sistema de generación.

Implicaciones prácticas

Para cualquiera que evalúe evidencia en video (periodistas, profesionales legales, moderadores de contenido o investigadores de seguridad), el punto práctico clave es que ninguna señal forense es suficiente por sí sola. La detección más confiable combina múltiples métodos de análisis independientes: análisis de artefactos a nivel de fotograma, puntuación de coherencia temporal, análisis del movimiento ocular, medición de sincronización audiovisual y examen de artefactos de compresión. El proceso de análisis de vídeo de SUS IT aplica este enfoque multidimensional, examinando tanto fotogramas individuales como patrones temporales a lo largo de toda la duración del clip. El resultado es un veredicto ponderado por confianza que refleja la convergencia de múltiples señales independientes en lugar de una sola prueba.

Artículos relacionados

Prueba SUS IT gratis

Regístrate y obtén 1 escaneo gratis para analizar cualquier archivo o enlace en busca de IA.

Empezar gratis