¿Hasta qué punto es fiable una puntuación de IA de Turnitin en documentos cortos?

Si tu trabajo tiene solo unos cientos de palabras, una puntuación de IA de Turnitin se comporta de forma distinta a como lo hace en un ensayo largo. El propio Turnitin dice que la predicción en documentos cortos es básicamente «all or nothing» (todo o nada), porque se examina un único segmento. Por debajo de 300 palabras directamente no hay puntuación: los requisitos de archivo fijan ese mínimo. Este artículo explica las declaraciones oficiales, por qué un contenido mixto puede parecer enteramente generado por IA y cómo leer la puntuación de un documento corto sin reaccionar de más.

Equipo de HumanPen

· 4 min de lectura

Lo que dice Turnitin sobre los envíos cortos

Las palabras del propio Turnitin sobre los documentos cortos son directas: «In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (En los documentos más cortos, donde solo hay unos cientos de palabras, la predicción será sobre todo «todo o nada», porque estamos prediciendo sobre un único segmento y no hay oportunidad de solapamiento.)

Esa frase viene de las preguntas frecuentes de Turnitin sobre la detección de escritura con IA. Describe qué ocurre con la predicción cuando no hay texto suficiente: el modelo no se queda a medias, se decide. Un trabajo corto tiende a juzgarse en conjunto, no frase por frase.

Esto importa porque casi todo lo que la gente da por hecho sobre las puntuaciones de IA viene de ensayos largos. En un documento largo, el detector trabaja sobre muchos segmentos y el porcentaje puede reflejar una mezcla. En un documento corto hay menos margen para esos matices.

Por qué sale todo o nada

La razón está en el mecanismo. Turnitin lo describe así: «sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated.» (Las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección se clasifica con el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA.)

En un trabajo largo, esas secciones superpuestas dan al modelo muchas oportunidades de mirar las mismas frases desde ángulos distintos. Las puntuaciones de las frases se agrupan y luego se agregan en la puntuación del documento, lo que suaviza el resultado —la misma agregación que se describe en qué comprueba la detección de IA de Turnitin y cómo se construye la puntuación.

Con solo unos cientos de palabras, en la práctica hay una sola sección. Sin solapamiento, sin agrupar varias miradas. La puntuación del documento hereda el juicio de una única clasificación, y por eso la predicción queda más cerca del «todo» o de la «nada» que de cualquier punto intermedio.

El contenido mixto puede puntuarse como enteramente de IA

La consecuencia aparece en la frase siguiente de Turnitin: «This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Esto significa que parte del texto que mezcla contenido generado por IA y contenido original podría marcarse como enteramente generado por IA.)

Así que, en un trabajo corto, una página escrita casi toda por ti que contiene un pasaje generado por IA puede puntuarse como si todo fuera de IA. El modelo no tiene suficientes secciones para separar ambas cosas. No está diciendo que cada parte del documento la generara una IA; está diciendo que la predicción se ha colapsado en un único juicio —una de las vías por las que una puntuación de IA del 100 % en Turnitin puede seguir siendo humana.

Por eso dos trabajos cortos con el mismo porcentaje real de texto de IA pueden acabar pareciendo completamente distintos. La puntuación no es una medida precisa de cuánto del documento es de IA. Es una predicción hecha con material limitado.

Por debajo de 300 palabras no hay puntuación que leer

Hay una frase que la gente cita aquí, y de dónde viene importa. Turnitin escribió, en una nota de versión fechada el 15 de diciembre de 2023: «our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.» (Nuestra precisión aumenta con un poco más de texto, así que los envíos con menos de 300 palabras pueden dar lugar a una puntuación de escritura con IA probablemente menos precisa.) Esa nota se titula «AI writing detection processing bug fix,» (corrección de un error de procesamiento en la detección de escritura con IA), el párrafo anterior a la frase dice «This issue has now been resolved,» (este problema ya se ha resuelto), y el error era que los envíos de menos de 300 palabras se estaban procesando. La frase describe informes generados entre el 6 y el 15 de diciembre de 2023.

Eso hace que hoy sea difícil aplicarla. Con el error corregido, un envío de menos de 300 palabras de prosa no recibe una puntuación menos precisa. No recibe ninguna puntuación. Los requisitos actuales de archivo dicen que un archivo «must have at least 300 words of prose text in a long-form writing format,» (debe tener al menos 300 palabras de texto en prosa en un formato de escritura extenso), así que, si estás por debajo de ese mínimo y te preparas para un porcentaje poco fiable, lo que verás en realidad es que no hay AI Writing Report. Cuánto de un envío cuenta como texto es otra pregunta, tratada en qué se considera texto calificable en la detección de IA de Turnitin.

Si estás mirando un envío muy corto, el número del informe debe tratarse como un indicio aproximado, no como una medición.

Cómo leer la puntuación de un documento corto

La recomendación de Turnitin para cualquiera que lea una puntuación de IA es la misma, sea el documento largo o corto: «the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors.» (El porcentaje del indicador de escritura con IA no debe usarse como única base para actuar ni como medida de calificación definitiva por parte del profesorado.)

En documentos cortos esto importa aún más, porque la puntuación es a la vez todo o nada y menos precisa. Una respuesta contundente a la puntuación de un documento corto trata una predicción aproximada como si fuera un dato medido. Turnitin también dice que la puntuación «is not meant to provide definitive answers in isolation,» (no pretende dar respuestas definitivas por sí sola), y que quien la lea debe equilibrar ese número con el conocimiento personal del estudiante y de su trabajo. Sus páginas dirigidas al profesorado van más allá y exponen qué se indica al profesor que haga cuando el porcentaje de IA es alto.

La lectura práctica es sencilla. Una puntuación baja en un trabajo corto merece una pregunta; una puntuación alta en un trabajo corto también, antes de que nadie la trate como un veredicto sobre todo el texto.

Seguir leyendo