Por qué el mismo texto obtiene una puntuación distinta en cada detector
En el estudio de Stanford, 89 de 91 ensayos fueron marcados por al menos un detector y solo 18 por los siete. Los mismos ensayos, el mismo día: las herramientas discreparon en 71 de ellos.
Equipo de HumanPen
· 5 min de lectura
El desacuerdo es medible, y es grande
La cifra publicada más clara procede del estudio de Stanford sobre escritores no nativos, que suele citarse por su tasa de falsos positivos de titular. Fíjate más bien en las dos cifras que hay debajo.
- 89 de 91 ensayos TOEFL (97,80 por ciento) fueron marcados como IA por al menos uno de los siete detectores.
- 18 de 91 (19,78 por ciento) fueron marcados por los siete.
Quedan así 71 ensayos —cuatro de cada cinco del corpus— en los que las siete decisiones binarias no fueron unánimes. Los recuentos publicados demuestran un desacuerdo en la clasificación, aunque no nos dicen cuánto se separaban las puntuaciones subyacentes en cada caso.
En esos ensayos, la herramienta elegida por una institución podía decidir si aparecía o no una marca. Eso es un problema de dependencia del producto, no la prueba de que un detector concreto se equivocara siempre.
La fecha importa. El estudio capturó siete productos a principios de 2023 y varios han cambiado desde entonces de modelo, de umbrales o de interfaz de informes. No debe usarse como una tabla de clasificación actual. Su resultado duradero es metodológico: las salidas de los detectores no son intercambiables, de modo que la puntuación de un proveedor no puede confirmar ni anular la de otro sin una comparación nueva y controlada.
Incluso una segunda pasada con el mismo proveedor puede dar un resultado distinto si el servicio se actualizó sin avisar, si la cuenta tiene otras funciones activadas o si el documento se procesó de otra manera. Por eso la reproducibilidad exige algo más que guardar el texto: conserva el archivo original, el informe, la fecha, el nivel de producto, el idioma configurado y, si está disponible, la versión del modelo. Una captura de pantalla con un solo porcentaje, sin ese contexto, es muy difícil de auditar después.
Por qué discrepan
Porque no son implementaciones de una única medición. Son productos distintos.
- Modelos subyacentes distintos. Un detector que mide la perplejidad frente a GPT-2 y otro que ejecuta un clasificador de aprendizaje profundo entrenado para ese fin le hacen a la misma frase preguntas diferentes.
- Arquitecturas que cambian con el tiempo. GPTZero abandonó la perplejidad y la ráfaga en otoño de 2023; otros no lo hicieron. Comparar proveedores es en parte comparar generaciones distintas de método.
- Distribuciones de entrenamiento distintas. Lo que cuenta como escritura humana normal depende de con qué textos se entrenó el clasificador. Ese es el mecanismo que hay detrás del sesgo contra los hablantes de inglés como segunda lengua, y varía según el proveedor.
- Umbrales y reglas de presentación distintos. Turnitin ahora oculta las puntuaciones numéricas de 1 a 19 por ciento; otros muestran una cifra en todos los niveles. La misma señal de fondo puede presentarse de formas distintas antes incluso de que la veas.
- Unidades distintas. Un porcentaje puede significar la confianza sobre el documento, otro la proporción de frases etiquetadas como IA y otro la proporción de prosa calificable. Cifras que parecen iguales no tienen por qué responder a la misma pregunta.
- Preprocesamiento distinto. Las herramientas pueden eliminar las referencias, ignorar las viñetas, dividir las frases de otra forma o recortar los documentos largos. Pueden estar puntuando un texto diferente mientras parece que reciben el mismo archivo.
La longitud agrava estas diferencias. Un detector que necesita varios cientos de palabras puede usar patrones de todo el documento; una herramienta de navegador que acepta un solo párrafo tal vez se apoye en rasgos locales. El idioma también importa: no se puede asumir que un modelo calibrado para el inglés se comporte igual con pasajes traducidos o con una bibliografía bilingüe.
Los porcentajes no usan la misma unidad
Las definiciones de los propios proveedores explican por qué no se pueden comparar porcentajes aparentemente iguales hasta que se sabe qué unidad hay detrás. Comprobado el 28 de agosto de 2026:
| Proveedor y salida | Qué dice el proveedor que significa el porcentaje | El límite que marca el propio proveedor |
|---|---|---|
| El informe AI Writing Report de Turnitin | La cantidad de texto calificable que el modelo identifica como probablemente generado por IA, o como probablemente generado por IA y modificado después. Es una proporción sobre la prosa calificable, no una puntuación de confianza. | Turnitin señala que el modelo puede identificar mal un texto y que no debe ser la única base para adoptar medidas perjudiciales. |
| La puntuación de detección de IA de Originality.ai | Una probabilidad de clasificación. En su ejemplo se dice que 60 % Original significa que el modelo tiene un 60 % de confianza en su predicción de Original. | En su página se añade que eso no significa que el 60 % del texto fuera original y el 40 % estuviera generado por IA, y se reconoce que los falsos positivos existen. |
| Probabilidad de clase en la API de GPTZero | La probabilidad asociada a la clase predicha: humana, IA o mixta. GPTZero explica el 90 % así: el detector acierta el 90 % de las veces con documentos similares. | La afirmación se limita a documentos similares y a la clase predicha por la API; no sostiene que el 90 % de las palabras enviadas sean de IA. |
| La puntuación humana de Winston AI | Una estimación de confianza en que el contenido fue creado por una persona. En su página se dice que 80 % humano y 20 % IA significa un 80 % de confianza en la autoría humana, no un 20 % de texto de IA. | Winston señala que su valoración no es exigible y que su mapa de predicciones puede resaltar texto humano. |
Turnitin informa, por tanto, de una proporción sobre un subconjunto calificable del documento, mientras que los otros tres ejemplos informan de la confianza en torno a una etiqueta de clase. El mismo símbolo, el porcentaje, está haciendo trabajos matemáticos distintos. Pasar la cifra de un proveedor a la escala de otro no es una segunda opinión: cambia la pregunta.
Un mismo proveedor puede mostrar dos porcentajes distintos
Las propias páginas públicas de GPTZero hacen visible el problema de la unidad sin necesidad de comparar dos empresas. Su documentación de la API y la página del detector web describen dos salidas distintas, ambas con signo de porcentaje. Comprobado el 28 de agosto de 2026:
| Superficie y campo de GPTZero | Redacción literal de primera mano | Unidad que respalda esa redacción |
|---|---|---|
| Probabilidad de clase en la API | "The class probability corresponding to the predicted class can be interpreted as the chance that the detector is correct in its classification." (La probabilidad de clase correspondiente a la clase predicha puede interpretarse como la probabilidad de que el detector acierte en su clasificación.) | Probabilidad de que la clase de documento predicha sea correcta en documentos similares |
| Resultado del detector web | "GPTZero will suggest what percentage of your text is likely to be AI-generated and highlight the specific phrases it has detected." (GPTZero indicará qué porcentaje de tu texto es probable que haya sido generado por IA y resaltará las frases concretas que ha detectado.) | Proporción del texto enviado descrita como probablemente generada por IA |
Pueden ser campos de salida distintos en lugar de una contradicción. La regla práctica es nombrar la superficie del producto y el campo. Una frase escueta como «GPTZero devolvió 30 %» no permite saber qué magnitud representa esa cifra.
Dos servicios chinos usan el signo de porcentaje para afirmaciones distintas
El mismo desajuste de unidades aparece en dos descripciones actuales de primera mano en China. La redacción citada abajo se comprobó el 28 de agosto de 2026.
| Servicio y salida | Redacción literal de primera mano | Qué respalda esa redacción | Comprobado |
|---|---|---|---|
| Servicio de detección de AIGC para tesis de grado de CNKI | "检测结果中的AIGC值表示的是文章内容存在AI生成的概率大小" (El valor AIGC del resultado de la detección expresa la probabilidad de que el contenido del artículo incluya generación por IA.) | Una afirmación de tipo probabilístico sobre la presencia de generación por IA en el artículo; la página no la define como una proporción de palabras o de frases | 28 de agosto de 2026 |
| Detección de AIGC de Wanfang Wencha | "精准识别论文中疑似AI生成文本占比" (Identificar con precisión la proporción de texto presuntamente generado por IA en el trabajo) | Una proporción de texto sospechoso de haber sido generado por IA | 28 de agosto de 2026 |
Estas afirmaciones asocian el mismo símbolo visual a magnitudes distintas: probabilidad de presencia frente a proporción de texto sospechoso. Un valor del 30 % en una página no puede ponerse al lado del 30 % de la otra sin cambiar antes la unidad, y ninguna de las dos publica una regla de conversión.
Algunos detectores apenas ofrecen una escala
Hay un detalle más al comparar puntuaciones. En una evaluación comparativa, algunas salidas se concentran cerca de 0 o de 1, mientras que otras ocupan más parte de la escala. Eso no significa necesariamente que el modelo subyacente carezca de puntuación continua: los umbrales, el redondeo y la interfaz pueden hacer que una señal continua parezca binaria.
HumanizerBench, que pasa cinco detectores comerciales por cada muestra, utiliza la mediana en lugar de la media exactamente por este motivo: si en el conjunto hay detectores que binarizan, un solo valor atípico mueve la media hasta 0,25. Su página de metodología lo dice sin rodeos.
Una media sobre esas salidas es matemáticamente posible, pero su interpretación no está clara cuando las entradas usan unidades y calibraciones distintas. Una mediana reduce la influencia de un valor extremo; no revela la verdad de fondo ni convierte en independientes a los detectores que la componen. HumanizerBench es una comparativa de productos publicada, no un estudio de validación institucional, así que su decisión de agregación debe leerse en ese ámbito.
El voto por mayoría tiene una limitación parecida. Cinco herramientas correlacionadas y entrenadas con corpus que se solapan no son cinco testigos independientes. La coincidencia puede reflejar puntos ciegos compartidos, y la discrepancia puede no ser más que umbrales distintos. Sin conjuntos de prueba etiquetados, con textos humanos y generados que se correspondan con la población objetivo, no hay forma rigurosa de convertir esos votos en una probabilidad de autoría.
Qué hacer con esto
De aquí salen cuatro conclusiones, ninguna de ellas sobre técnica de escritura.
- Si hay un procedimiento institucional en marcha, identifica el informe que se usa de verdad. Consultar a otro proveedor te dice lo que ese proveedor opina; no puede reproducir la herramienta, los ajustes ni la versión de la institución.
- Una segunda opinión que te exculpa no es una exoneración, y una que te marca no es una prueba. Ambas son la salida de un único clasificador sobre un texto cuyas propiedades otros varios clasificadores leen de otra manera.
- Pregunta para qué se usa la puntuación. Turnitin afirma que su modelo puede identificar mal un texto y que no debe ser la única base para medidas perjudiciales. El resultado de un detector es un dato para la revisión, no una conclusión de mala conducta.
- Si comparas herramientas para investigar, mantén las condiciones fijas. Usa la misma versión, la entrada completa, el mismo idioma, la misma fecha y el mismo corpus etiquetado; registra también los fallos y el texto excluido, no solo la cifra mostrada.
En una apelación, las capturas de pantalla contrapuestas suelen añadir ruido. Las pruebas de proceso —borradores, notas, anotaciones de fuentes, historial de revisiones y la capacidad de explicar las decisiones— hablan de la autoría mucho más directamente que otro clasificador opaco. Para el profesorado, el desacuerdo es un motivo para diseñar un procedimiento de corroboración antes de que llegue un caso difícil, y no después.
Para la contratación, compara el error por subgrupo y por género textual en lugar de preguntar qué proveedor declara la mayor exactitud global. Exige una política de actualización documentada, un registro de auditoría de las versiones de los informes, reglas claras sobre el texto calificable y una exportación a la que el estudiante pueda responder de forma significativa. El desacuerdo es menos peligroso cuando la institución sabe exactamente qué aporta la herramienta y ha definido qué pruebas pueden prevalecer sobre ella.
Sobre qué mide en realidad esa cifra, consulta qué miden realmente los detectores de IA.
Seguir leyendo
Qué miden los detectores de IA más allá de la perplexity y la burstiness
6 min de lectura
Informes de detección¿Es demasiado alto un 20% de IA? Por qué no existe un umbral absoluto
5 min de lectura
Detectores de IAPor qué los detectores de IA señalan con más frecuencia a escritores no nativos de inglés
8 min de lectura