¿Qué es el «texto calificable» en la detección de IA de Turnitin? Una explicación detallada

Cuando Turnitin informa de un porcentaje de escritura con IA, esa cifra no cubre todo tu envío. El modelo solo analiza el «texto calificable», es decir, frases en prosa con una gramática estándar. Las listas, las viñetas y las estructuras que no forman frases quedan fuera. Por eso el porcentaje y los fragmentos resaltados a veces no concuerdan. Esto es lo que dice la documentación sobre qué cuenta, qué no y por qué importa.

Equipo de HumanPen

· 5 min de lectura

Qué significa «texto calificable»

El modelo de detección de IA de Turnitin no analiza todas las palabras de un documento. Trabaja con un subconjunto concreto del texto, el llamado «texto calificable». La documentación lo define con claridad.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Este texto calificable incluye únicamente frases en prosa, lo que significa que solo analizamos bloques de texto escritos con frases gramaticalmente estándar y que no incluyen otros tipos de escritura, como listas, viñetas (estructuras cortas que no son frases) u otras estructuras que no son frases.)

El modelo busca prosa: bloques de texto organizados en frases gramaticalmente estándar. Todo lo que no llega a ese listón queda fuera del análisis. Las viñetas, las listas numeradas, los encabezados de tabla que no son frases completas y otras estructuras que no son prosa quedan excluidas del alcance de la detección de IA.

La propia documentación del modelo reconoce esta limitación: "The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (El modelo no detecta de forma fiable el texto generado por IA en forma de texto que no es prosa o de código, y tampoco detecta escritos breves o poco convencionales, como las viñetas (estructuras cortas que no son frases).)

Si un documento tiene muchas listas y poca prosa, el modelo de detección de IA cuenta con menos material y la puntuación que ves refleja solo las partes en prosa. También hay un mínimo: los requisitos de archivo piden al menos 300 palabras de prosa antes de generar siquiera un informe, y es justo ahí donde entra la duda de si Turnitin puede revisar una tesis completa.

La discrepancia entre el porcentaje y los fragmentos resaltados

Uno de los aspectos más confusos del informe de detección de IA de Turnitin es que el porcentaje y los fragmentos resaltados parecen contar historias distintas. La documentación explica por qué.

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Esto significa que un documento con varios tipos de escritura distintos daría lugar a una discrepancia entre el porcentaje y los fragmentos resaltados.)

"This percentage is not necessarily the percentage of the entire submission." (Este porcentaje no es necesariamente el porcentaje de todo el envío.)

Si tu documento es 50 % prosa y 50 % viñetas, y el modelo marca el 40 % de la prosa como generada por IA, el informe podría mostrar un 40 % de IA. Pero ese 40 % se refiere a la prosa calificable, no al documento completo. Quien lea el informe sin saber esto podría pensar que todo el envío tiene un 40 % de IA, cuando la proporción real sobre el documento completo es menor.

Esta discrepancia no es un error. Es consecuencia del alcance del modelo. Entenderla te ayuda a leer el informe con precisión, y cómo leer un informe de escritura con IA de Turnitin recorre el resto de la página.

Cómo procesa el modelo el texto

Para entender por qué importa el texto calificable, conviene saber qué hace el modelo con él. La documentación describe el mecanismo:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Cuando se envía un trabajo a Turnitin, las frases del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. El modelo de detección de IA clasifica cada sección y le asigna un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA.)

El modelo extrae las frases, las divide en secciones superpuestas y clasifica cada sección. Cada una recibe una puntuación de probabilidad entre 0 y 1. Por este proceso solo pasan las frases de prosa calificable. El contenido que no es prosa nunca se divide ni se puntúa, porque el modelo no lo trata como texto analizable.

Por eso el alcance del «texto calificable» determina directamente qué representa el porcentaje. La puntuación es un agregado de las probabilidades a nivel de sección, y solo las frases de prosa calificable forman parte de ese agregado.

Las tablas entran, las bibliografías no

Dos tipos de contenido concretos tienen sus propias reglas.

Tablas: "We are now able to process long-form prose text in tables." (Ahora podemos procesar texto en prosa de formato largo dentro de tablas.) La prosa dentro de las celdas de una tabla, si está escrita con frases gramaticalmente estándar, cuenta ya como texto calificable. Vuelve a enviar los trabajos existentes que contengan tablas para que se procesen de nuevo. Si tienes un documento con prosa relevante en tablas y se envió antes de esta actualización, puede que la puntuación de IA no refleje el contenido de las tablas hasta que lo vuelvas a enviar.

Bibliografías: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (Hemos corregido un error que hacía que a veces se resaltara escritura con IA dentro de las referencias de una bibliografía. Las bibliografías quedan ahora excluidas al procesar el informe de escritura con IA.) Vuelve a enviar los trabajos existentes que contengan secciones de referencias resaltadas para que se procesen de nuevo. Si tu informe anterior mostraba texto marcado dentro de tu lista de referencias, eso era un error, y al volver a enviarlo esas secciones quedarán fuera del análisis. Por qué Turnitin marca mis referencias y citas explica hasta dónde llegan las exclusiones en el lado de la similitud.

Estas dos reglas significan que la definición de texto calificable no es fija. Se ha afinado para incluir la prosa en tablas y excluir las bibliografías, y esa es una de las razones por las que tu puntuación de IA de Turnitin puede cambiar al reenviar sin que cambie el texto.

Falsos positivos en la prosa calificable

Incluso dentro de la prosa calificable, hay formas de escribir más propensas a los falsos positivos. La documentación señala patrones concretos.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A veces los falsos positivos (marcar por error como generado por IA un texto escrito por una persona) pueden incluir contenido con poca variación estructural, texto que se repite literalmente o texto parafraseado sin desarrollar ideas nuevas.)

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Si nuestro indicador muestra una mayor cantidad de escritura con IA en ese tipo de texto, te aconsejamos que lo tengas en cuenta al mirar el porcentaje indicado.)

Así que si tu prosa es monótona desde el punto de vista estructural, repite las mismas expresiones o está parafraseada sin aportar ideas nuevas, el modelo puede marcarla como generada por IA aunque la hayas escrito tú. Esto no es un fallo del filtro de texto calificable, es qué miden los detectores de IA haciendo exactamente aquello para lo que se entrenó. Es un problema distinto, dentro de la prosa que sí entra en el análisis.

Qué significa esto para ti

Si quieres entender por qué tu informe de IA de Turnitin tiene el aspecto que tiene, aquí tienes el resumen:

  • Solo cuentan las frases en prosa. Las listas, las viñetas y las estructuras que no forman frases quedan fuera del análisis. El modelo se centra en frases gramaticalmente estándar.
  • El porcentaje cubre solo la prosa calificable. No es el porcentaje de todo el envío. De ahí la discrepancia entre la cifra y los fragmentos resaltados.
  • La prosa en tablas ya se procesa. El texto en prosa de formato largo dentro de tablas cuenta como texto calificable. Vuelve a enviar los trabajos existentes que contengan tablas para que se procesen de nuevo.
  • Las bibliografías quedan excluidas. Se ha corregido el error que marcaba las referencias. Vuelve a enviar los trabajos existentes que contengan secciones de referencias resaltadas para que se procesen de nuevo.
  • Ojo con los falsos positivos. La prosa plana, repetitiva o parafraseada tiene más probabilidades de ser marcada. Tenlo en cuenta al leer el porcentaje.

Los fragmentos que cumplen los requisitos se pueden volver a procesar sin coste.

Seguir leyendo