Por qué Turnitin dice que tu trabajo es 100 % IA

El 100 % no es una versión más segura del 60 %. En el relato del propio Turnitin sobre cómo se arma esa cifra, los extremos son justo el punto en el que el cálculo tenía menos cosas entre las que promediar.

Equipo de HumanPen

· 11 min de lectura

Empieza por aquí, antes de la explicación

Tres situaciones producen un 100 mucho más a menudo que la idea de que cada frase que escribiste suena como si la hubiera redactado una máquina, y puedes confirmarlas o descartarlas en unos diez minutos. Comprueba qué número tienes en la mano: según Turnitin, el indicador de escritura con IA no es visible para el alumnado, así que un porcentaje que encontraste tú mismo, dentro de tu propia vista, es la puntuación de similitud y no la de IA. Comprueba cuánta prosa continua contiene el archivo: Turnitin dice que en documentos de apenas unos cientos de palabras la predicción es «mostly 'all or nothing'» (casi siempre «todo o nada»), porque se predice sobre un único segmento y sin oportunidad de solaparse. Comprueba de qué es el 100: el porcentaje se calcula sobre el texto calificable, y Turnitin dice que esa cifra «is not necessarily the percentage of the entire submission» (no es necesariamente el porcentaje de todo el envío). Solo cuando las tres quedan descartadas tiene sentido preguntar qué vio el modelo en la escritura misma.

Las tres exigen respuestas completamente distintas, y por eso el orden importa más que la explicación. Esta página va de cómo se produce una cifra extrema. No es un guion para una reunión por mala conducta académica, y nada de lo que hay aquí predice lo que dirá un informe futuro.

Primero, comprueba qué 100 tienes entre manos

Turnitin es explícito sobre quién puede ver la cifra de IA. Sus guías dicen que «only instructors and administrators are able to see the indicator» (solo el profesorado y el personal administrativo pueden ver el indicador), y por separado que «The AI writing detection indicator and report are not visible to students.» (El indicador y el informe de detección de escritura con IA no son visibles para el alumnado). La frase inmediatamente posterior a esa segunda importa igual: «However, with the PDF download feature, instructors can download and share the AI report with students.» (Sin embargo, con la función de descarga en PDF, el profesorado puede descargar y compartir el informe de IA con el alumnado). Así que existen las dos vías. Un PDF que alguien te envió bien puede ser el informe de IA. Un porcentaje al que entraste tú mismo, en tu propia vista del envío, no es el indicador de IA.

Eso deja la otra cifra, y allí el 100 es un valor mucho más corriente. Una puntuación de similitud del 100 % tiene una vía documentada y completamente inocente: tus propios borradores anteriores, guardados en otra tarea, coincidiendo con tu versión final casi palabra por palabra. Rastreamos cómo ocurre eso, y cuándo no, en ¿coincidirá mi borrador anterior con mi reenvío?. Los dos informes son análisis separados que pueden discrepar en las cuatro direcciones, que es el tema de informe de IA frente a informe de similitud.

Un 100 en el lado de la similitud y un 100 en el lado de la IA son hallazgos distintos, con causas distintas y respuestas distintas. Pasarse una tarde entera con la cifra equivocada es la forma más común de que esto salga mal.

Los documentos cortos se puntúan a todo o nada

La descripción publicada por Turnitin del cálculo tiene tres movimientos: las frases se extraen y se agrupan en segmentos solapados, cada segmento recibe una probabilidad entre 0 y 1, y cada frase calificable hereda la puntuación de cada segmento en el que se encuentra. Como los segmentos se solapan, una frase cercana a un límite lleva más de una puntuación, que después se agrupan. Esas puntuaciones agrupadas de las frases son lo que se agrega en la cifra del documento. El promediado es toda la razón por la que un documento puede volver con un 43 en lugar de con uno de los extremos.

Ahora quita eso. Las preguntas frecuentes de Turnitin dicen qué pasa cuando no hay nada entre lo que promediar:

«In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (En documentos más cortos, de apenas unos cientos de palabras, la predicción será casi siempre «todo o nada», porque estamos prediciendo sobre un único segmento sin oportunidad de solapamiento. Esto significa que un texto que mezcla contenido generado por IA y contenido original podría marcarse como enteramente generado por IA.)

Lee eso como una afirmación sobre la resolución y no sobre la precisión. En un documento largo, un 100 significaría que un gran número de predicciones independientes cayeron todas del mismo lado. En un documento de unos cientos de palabras puede significar una sola predicción, que la interfaz después muestra como porcentaje. Ambas cosas se muestran igual y no son el mismo tipo de evidencia, y la segunda frase de esa cita dice sin rodeos que es el contenido mezclado lo que queda arrastrado.

Debajo de esto hay un mínimo. Un envío necesita al menos 300 palabras de prosa en formato largo antes de que se genere siquiera un informe de IA. Así que el archivo más corto que puede recibir una cifra es también aquel cuya cifra se apoya en el menor número de observaciones independientes, y la franja justo por encima del mínimo es donde esos dos hechos se solapan. Un trabajo reflexivo de 900 palabras, la redacción breve de un conjunto de problemas, un resumen de congreso rellenado hasta alcanzar la extensión: todos están en la zona que Turnitin describe. Qué ocurre en el otro extremo del rango, cuando una tesis excede lo que cubre un informe, lo repasamos en puede Turnitin revisar una tesis completa.

¿100 % de qué, exactamente?

El porcentaje no se calcula sobre tu documento. Se calcula sobre lo que Turnitin llama texto calificable, y la definición es estrecha: «This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures.» (Este texto calificable incluye únicamente frases de prosa, lo que significa que solo analizamos bloques de texto escritos con frases gramaticalmente estándar y que no incluimos otros tipos de escritura como listas, viñetas (estructuras cortas que no son frases) u otras estructuras que no son frases). La frase que sigue es la que hay que retener: «This percentage is not necessarily the percentage of the entire submission.» (Este porcentaje no es necesariamente el porcentaje de todo el envío).

Algunas exclusiones se indican por separado. Las notas de versión de Turnitin registran que se corrigió un error que marcaba escritura con IA dentro de las bibliografías y que «Bibliographies are now excluded when processing the AI writing report» (Las bibliografías quedan ahora excluidas al procesar el informe de escritura con IA), y en otro lugar que «We are now able to process long-form prose text in tables.» (Ahora podemos procesar texto de prosa extenso en tablas). Ambas entradas terminan igual, con la indicación de no asumir que el cambio se aplica a lo que ya enviaste: vuelve a enviar para reprocesar. Así que una lista de referencias queda fuera del cálculo y los párrafos dentro de una tabla quedan dentro, que no es la intuición que la mayoría tiene sobre ninguna de las dos cosas.

Pasa un archivo real por eso. Un informe de laboratorio de 5.000 palabras con una tabla de métodos, tres listas de protocolo con viñetas, un apéndice y 60 referencias podría contener 2.000 palabras calificables. Un 100 en ese informe es una afirmación sobre esas 2.000 palabras. No es una afirmación sobre las otras 3.000, que nunca se evaluaron y que no pueden defenderse ni atacarse con base en la cifra.

Esto también explica por qué un 100 puede convivir con páginas que no llevan ningún resaltado. Turnitin dice que un documento con varios tipos de escritura distintos «would result in a disparity between the percentage and the highlights» (daría lugar a una discrepancia entre el porcentaje y los resaltados). En lo alto del rango esa discrepancia parece una contradicción, y es un comportamiento esperado.

Contar líneas resaltadas y compararlas con el porcentaje no lo resolverá, porque ambos se calculan sobre cosas distintas. Cómo leer un informe de escritura con IA de Turnitin repasa el resto de los estados del informe por la misma razón.

Cuando el documento es largo y aun así vuelve con la cifra máxima

Si el archivo tiene 8.000 palabras de prosa continua, la explicación del segmento único desaparece. Muchas predicciones independientes sí cayeron del mismo lado, y la pregunta pasa a ser qué haría que un documento entero le pareciera igual al modelo de principio a fin. Turnitin publica una respuesta parcial, en forma de las propiedades que dice aparecer en sus propios falsos positivos:

«Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (A veces los falsos positivos —marcar por error como generado por IA un texto escrito por una persona— pueden incluir contenido con poca variación estructural, texto que se repite literalmente o texto parafraseado sin desarrollar ideas nuevas. Si nuestro indicador muestra una cantidad mayor de escritura con IA en un texto así, te recomendamos tenerlo en cuenta al mirar el porcentaje indicado.)

Esas tres propiedades son propiedades de un documento completo y no de una frase. Esa es nuestra lectura y no algo que Turnitin afirme, pero es la parte que encaja con la forma de la pregunta: un trabajo escrito siguiendo un orden de secciones impuesto, en una disciplina con una manera fija de formular el párrafo de métodos, que repite sus propios objetivos en el resumen y otra vez en la introducción y otra vez en la discusión, tiene más o menos el mismo carácter en cada segmento. No hay ningún pasaje que difiera lo suficiente de sus vecinos como para arrastrar el agregado hacia abajo. La uniformidad no es un defecto de escritura, y en varios géneros es el requisito, que es exactamente por lo que el resultado es difícil de discutir señalando un solo párrafo.

La segunda frase de esa cita es una instrucción del proveedor a quien lee la puntuación, no una defensa que puedas construir tú. Lo que de verdad ha movido decisiones es otro asunto, y lo escribimos a partir de casos publicados en marcado, pero lo escribiste tú. Si editar es apropiado y está permitido, las propiedades de esa lista son también lo más parecido a una especificación para hacerlo a mano, que es el enfoque de cómo humanizar texto de IA sin una herramienta.

Lo que un 100 no resuelve

Algo que conviene saber antes de construir cualquier argumento sobre que la cifra está exagerada: el ajuste publicado va en la dirección contraria. Turnitin dice que «In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document» (Para mantener esta baja tasa del 1 % de falsos positivos, existe la posibilidad de que pasemos por alto parte del texto escrito con IA en un documento), y da la dirección del error: «if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing.» (si identificamos que el 50 % de un documento probablemente fue escrito por una herramienta de IA, podría contener hasta un 65 % de escritura con IA). Sea lo que sea lo que además esté pasando, la idea de que la herramienta está diseñada para informar de más no es el diseño que describe el proveedor.

Eso no convierte un 100 en un hallazgo. Turnitin declara en tres páginas de ayuda distintas que su modelo puede identificar mal texto escrito por personas, generado por IA y parafraseado por IA, y que no debe ser la única base para una medida adversa contra un estudiante. Y la afirmación de precisión que la gente se lanza unos a otros lleva una salvedad que se pierde por el camino, que es lo que desmontamos en qué significa una tasa de falsos positivos del 1 %. Tampoco existe un umbral publicado a partir del cual una cifra se convierte en mala conducta, en ninguna de las dos direcciones: ¿es demasiado alto un 20 % de IA? cubre por qué el 20 de la interfaz es una regla de visualización y no una regla sobre ti.

Si lo escribiste tú, reescribirlo es el primer movimiento equivocado. Cambia el objeto en discusión y responde a una pregunta que nadie hizo.

Dónde encaja una herramienta de reescritura y dónde un 100 la vuelve inútil

Conviene decirlo sin rodeos, aunque vaya en nuestra contra: con un 100, aquello para lo que la herramienta HumanPen normalmente sirve no tiene dónde agarrarse. Subes el documento junto con el informe de Turnitin o de iThenticate y solo se reescriben los pasajes que el informe emparejó, mientras el resto se conserva palabra por palabra, y la facturación cuenta únicamente las palabras realmente reescritas. Eso es un ahorro real con un 30 %, donde dos tercios del archivo nunca se tocan ni se cobran. Con un 100 % el informe lo ha marcado todo, así que el alcance es el documento completo y el coste, una pasada entera. Si esperabas que el informe acotara el trabajo, el 100 es justo la cifra con la que no lo hace.

Si un informe nuevo sigue marcando pasajes, los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.

Nada de eso es una promesa sobre un resultado de detección, y no vamos a hacerla. Ninguna herramienta puede decirte qué producirá una versión futura del modelo sobre un documento que no ha visto, y quien ofrece una puntuación garantizada está describiendo algo que no controla. También hay casos en los que la herramienta es directamente el instrumento equivocado: si tu posición es que el trabajo es tuyo, la cifra no es el objeto que hay que arreglar.

Preguntas frecuentes

¿Significa un 100 % que marcaron todas las frases que escribí? No. El porcentaje se calcula sobre el texto calificable, que excluye listas, viñetas y otras estructuras que no son frases, y Turnitin dice que la cifra no es necesariamente el porcentaje de todo el envío. Un archivo con tablas extensas, listas y una sección de referencias puede mostrar un 100 % mientras gran parte de él nunca se evaluó.

Mi ensayo tiene solo 600 palabras. ¿Es esa la explicación? Es lo primero que hay que comprobar. El propio Turnitin lo plantea así: en documentos de unos cientos de palabras la predicción es casi siempre «all or nothing» (todo o nada), porque trabaja sobre un único segmento sin oportunidad de solaparse, y por tanto una mezcla de contenido generado por IA y contenido original puede marcarse como enteramente generado por IA.

Vi la cifra en mi propia vista de Turnitin. ¿Es la puntuación de IA? Casi seguro que no. Turnitin dice que solo el profesorado y el personal administrativo pueden ver el indicador de IA y que no es visible para el alumnado, aunque el profesorado puede descargar el informe de IA en PDF y compartirlo. Un porcentaje al que llegaste tú mismo es la puntuación de similitud, que tiene sus propias vías corrientes hacia el 100.

¿Puede alguna herramienta garantizar que el próximo informe será más bajo? No, y trata esa afirmación como una señal de alarma. Las versiones de los detectores cambian, y nadie fuera del proveedor puede comprometerse con el resultado de una versión del modelo que aún no se ha ejecutado. Lo que un servicio de revisión puede definir es el alcance y el coste, no una puntuación.

Seguir leyendo