Cómo funcionan los detectores de ensayos de IA (y por qué no son perfectos)
Tim · Equipo editorial de SUS IT
Tim es ingeniero de software e investigador de inteligencia artificial especializado en metodologías de detección.
Los métodos estadísticos detrás de la detección de texto con IA: perplejidad, ráfagas y por qué incluso los mejores detectores tienen falsos positivos en la escritura humana.
Los detectores de escritura con IA se han convertido en una parte estándar de los flujos de trabajo educativos y editoriales. Las herramientas escanean los envíos de los estudiantes en busca de firmas de ChatGPT y Gemini, los editores verifican los manuscritos en busca de secciones escritas por IA y las plataformas analizan el spam generado por IA. Pero, ¿cómo funcionan realmente estos sistemas y por qué a veces señalan la escritura humana como generada por IA? Comprender la mecánica le ayuda a utilizar estas herramientas de forma adecuada y a evitar tratar una puntuación probabilística como un veredicto definitivo.
El problema central: el texto es sólo estadística
El lenguaje natural es fundamentalmente un fenómeno estadístico. Cada elección de palabra, estructura de oración y ritmo de párrafo refleja patrones aprendidos de la lectura y la experiencia. Los modelos de lenguaje de IA se entrenan con grandes cantidades de texto escrito por humanos, lo que significa que aprenden a producir un lenguaje humano estadísticamente plausible, que es, desafortunadamente, exactamente lo que los hace difíciles de detectar. El desafío para los sistemas de detección es encontrar las sutiles diferencias estadísticas entre el texto generado por humanos y el texto generado por IA que persisten en diferentes temas, estilos y contextos.
Perplejidad: ¿Qué tan predecible es cada palabra?
La métrica más utilizada en la detección de texto con IA es la perplejidad, una medida de cuán sorprendido está un modelo de lenguaje por cada palabra en el contexto anterior. La escritura humana tiende a una mayor perplejidad: elegimos palabras inesperadas, introducimos ideas novedosas, utilizamos modismos o jerga de dominio de maneras específicas y asumimos riesgos lingüísticos que un modelo estadístico asignaría con baja probabilidad. El texto generado por IA, al ser producido por un sistema entrenado para maximizar la probabilidad, tiende a una menor perplejidad: elecciones de palabras que son contextualmente apropiadas, comunes y predecibles. Un pasaje sostenido de un texto de baja perplejidad es una señal de que un modelo de lenguaje puede haberlo producido.
Burstiness: ¿Cuánto varía la complejidad?
La segunda señal importante es la ráfaga: la variabilidad en la longitud, estructura y complejidad de la oración dentro de un pasaje. La escritura humana "estalla" de forma natural: una frase larga y compleja seguida de una corta, un párrafo de denso contenido técnico seguido de una analogía, una declaración formal seguida de un comentario casual. Los modelos de lenguaje de IA tienden a una complejidad constante: cada oración se genera de manera algo independiente con profundidad y estructura similares, lo que produce un texto que fluye suavemente pero que carece de la calidad humana irregular del pensamiento natural. Los sistemas de detección miden la variación estadística de estas propiedades en todo el texto.
Por qué estas métricas no son infalibles
El problema de la perplejidad y la ráfaga como señales de detección es que son propiedades del texto, no de la autoría. La escritura académica formal –precisamente el tipo de escritura que se les pide a los estudiantes que escriban– tiende por diseño a una baja perplejidad y poca ráfaga. Se supone que un informe de ingeniería, un informe legal o una sección de métodos científicos deben ser claros, predecibles y estructurados de manera coherente. Éstas son características de una buena redacción formal, no de la generación de IA. Los escritores multilingües, que tal vez no utilicen toda la gama idiomática de su segunda lengua, también tienden a producir textos más predecibles estadísticamente. Los falsos positivos no son una señal de que el detector está roto; son una consecuencia inherente de aplicar medidas estadísticas a un dominio donde las estadísticas se superponen legítimamente.
El problema de los datos de entrenamiento
Los detectores de texto de IA están entrenados en conjuntos de datos de texto de IA y humanos conocidos. La calidad y diversidad de estos conjuntos de datos limita fundamentalmente la precisión de la detección. Un detector entrenado principalmente en salidas ChatGPT 3.5 puede no generalizarse bien a las salidas Claude 3.5 o GPT-4o, que tienen propiedades estadísticas diferentes. Es posible que un detector entrenado en texto en inglés no funcione bien en otros idiomas. Los detectores deben capacitarse continuamente en los resultados de nuevos modelos para mantener su precisión a medida que mejoran los modelos generativos, y siempre hay un desfase entre el lanzamiento de un nuevo modelo y la capacidad de un detector para identificar de manera confiable su resultado.
Detección de disparo cero frente a detección ajustada
Algunos sistemas de detección utilizan enfoques de "disparo cero": aplican un modelo de lenguaje previamente entrenado directamente para estimar la perplejidad sin capacitación específica para la tarea. Otros ajustan un clasificador específicamente para la detección de IA utilizando ejemplos etiquetados. Los métodos de disparo cero tienden a ser más transparentes (puedes entender exactamente lo que están midiendo) pero menos precisos. Los clasificadores ajustados pueden lograr una mayor precisión en su distribución de entrenamiento, pero pueden sobreajustarse a familias de modelos específicas. Los mejores sistemas de detección combinan múltiples enfoques y proporcionan estimaciones de confianza calibradas en lugar de veredictos binarios.
Qué hace un detector responsable
Una herramienta responsable de detección de texto con IA hace varias cosas: informa una puntuación con un nivel de confianza asociado, no solo una bandera binaria; destaca los pasajes específicos que más contribuyeron a la puntuación, lo que permite una revisión específica; reconoce los modos de fallo conocidos y los comunica a los usuarios; y recomienda la revisión humana para cualquier decisión importante. El análisis de documentos de SUS IT proporciona un texto de justificación que explica qué patrones desencadenaron el resultado de la detección, de modo que los usuarios puedan evaluar el razonamiento en lugar de simplemente aceptar un número. La detección sin explicación es una caja negra que invita al mal uso.
Qué hacer con el resultado de una detección
Si recibe una puntuación alta de probabilidad de IA en un texto que sabe que escribió, el siguiente paso es una revisión específica: agregue una perspectiva más personal, aumente la variación en la longitud de las oraciones, use un lenguaje más específico de dominio y ejemplos concretos de su propia experiencia. Pasar el texto revisado por el detector nuevamente le permite ver qué cambios redujeron la similitud estadística con la salida de IA. Si es un educador o editor que recibe contenido marcado de otra persona, trate la puntuación como un motivo de conversación, no como un veredicto. Pregúntele al autor sobre su proceso, revise los pasajes marcados y busque evidencia adicional antes de sacar conclusiones.