El 4 % de falsos positivos por frase de Turnitin: qué significaba en 2023
La explicación de Turnitin de junio de 2023 daba una cifra de alrededor del 4 % por frase. El objetivo de menos del 1 % por documento mide otra cosa. La condición del 20 % es un umbral de detección, no un requisito de que el trabajo contenga realmente texto de IA; ninguna de las dos cifras determina quién escribió un pasaje concreto.
Equipo de HumanPen
· 5 min de lectura
A qué se refiere exactamente el 4 %
La explicación de Turnitin de junio de 2023 describía como posiblemente humanas alrededor del 4 % de las frases ya marcadas como escritas por IA. Es una estadística sobre frases señaladas, no una probabilidad calibrada para una frase concreta de tu informe actual. Tampoco es el porcentaje de todas las frases humanas que serán señaladas.
Annie Chechitelli, directora de producto de Turnitin, lo explicó así en junio de 2023:
«Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content.» (Nuestra tasa de falsos positivos a nivel de frase ronda el 4 %. Esto significa que hay un 4 % de probabilidades de que una frase concreta marcada como escrita por IA esté en realidad escrita por una persona. Esto ocurre con más frecuencia en documentos que mezclan contenido escrito por personas y por IA, sobre todo en las transiciones entre unos y otros.)
La condición es que la frase ya haya sido señalada. En cambio, la tasa de falsos positivos por documento pregunta con qué frecuencia los documentos humanos activan una regla de detección. Los denominadores son distintos, por lo que no se puede convertir un porcentaje en el otro.
La tasa a nivel de documento es otra cifra
El mismo artículo de junio de 2023 también da una cifra por documento:
«Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing.» (Nuestra tasa de falsos positivos por documento, es decir, identificar erróneamente texto íntegramente humano como generado por IA, es inferior al 1 % cuando el criterio de clasificación exige un resultado de detección de escritura por IA del 20 % o más.)
Es fácil interpretar mal la frase: el 20 % se refiere a lo que informa el detector, no a una cantidad conocida de texto de IA realmente presente. El documento técnico de agosto de 2024 de Turnitin explica una regla de decisión por documento en la que más del 20 % de las puntuaciones de las frases superan un umbral del modelo. Prueba los falsos positivos con trabajos estudiantiles anteriores a 2019 descritos como íntegramente humanos. Un falso positivo es uno de esos trabajos humanos que supera el umbral de detección.
Qué dicen las tasas sobre un trabajo que escribiste tú
Los trabajos íntegramente humanos son precisamente lo que necesita una prueba de falsos positivos por documento. No quedan excluidos porque la regla de detección use un umbral del 20 %.
El artículo de 2023 dice que las frases mal señaladas aparecen con más frecuencia en documentos mixtos, sobre todo en las transiciones entre texto humano y texto de IA. Con más frecuencia no significa exclusivamente. No descarta errores de señalamiento en trabajos íntegramente humanos.
El objetivo de menos del 1 % describe la frecuencia con la que los documentos humanos activan la regla indicada bajo las condiciones de prueba del proveedor. No significa que un trabajo señalado tenga menos de un 1 % de probabilidad de ser humano. Eso invierte la condición que se está midiendo.
Ambas cifras ayudan a explicar que puede haber errores. Ninguna identifica al autor de tu pasaje concreto. Examina el texto señalado y el proceso de escritura en vez de usar una tasa como veredicto.
Dónde se agrupan los marcadores erróneos
Turnitin dio un dato concreto sobre dónde aparecen esas frases mal marcadas:
«As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing.» (Como expliqué en mi artículo anterior, existe una correlación entre estas frases y su proximidad en el documento a texto realmente escrito por IA. En el 54 % de los casos, estas frases están situadas justo al lado de texto escrito de verdad por IA.)
Estas frases son las escritas por personas que fueron señaladas por error. Según la explicación de 2023, el 54 % estaba junto a texto realmente escrito por IA. Esto describe una concentración observada de errores, no una regla que abarque todos los falsos positivos.
Esa observación no permite diagnosticar la causa de una marca en tu trabajo. No demuestra que haya texto de IA cerca ni descarta un error cuando no lo hay. Usa los pasajes señalados para orientar la revisión; las estadísticas de proximidad no pueden establecer la autoría.
Cómo dice Turnitin que hay que leer un marcador
El mismo artículo deja claro que un resaltado es un punto de partida, no una conclusión, y se lo dice al profesorado, que es justo quien tú quieres que lo lea:
«Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion.» (Considera las frases resaltadas como zonas de interés, porque se prevé que estén cerca de donde hay escritura por IA. Pero en un pequeño porcentaje de las veces el modelo de IA puede equivocarse. Así que usa la información para iniciar una conversación, no para sacar una conclusión.)
También descarta aquello con lo que los estudiantes más a menudo creen que se les está midiendo. No hay ninguna cifra que debas alcanzar:
«Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score.» (Recuerda que no existe una puntuación «correcta» ni una puntuación «objetivo» en el indicador de escritura por IA, igual que ocurre con el Similarity Score.)
Qué hacer con un informe que tiene dos frases marcadas
Nada de lo anterior te dice si tienes un problema, porque ninguna cifra publicada puede hacerlo. Lo que sí te da es una manera de mantener la conversación en el informe mismo y no en un porcentaje.
- Pregunta qué pasajes son, y consigue el informe en lugar de una captura de pantalla. Dos frases resaltadas y una cifra a nivel de documento son cosas distintas. Los resaltados son la única parte que tiene una ubicación a la que puedes señalar.
- Pregunta qué tasa se está citando y qué mide. El umbral del 20 % se refiere al resultado del detector. La tasa de falsos positivos por documento se mide con trabajos humanos; no es la probabilidad de que tu trabajo concreto señalado sea humano.
- Llévate contigo la instrucción del propio Turnitin. Dice al profesorado que use un resaltado para empezar una conversación, no para llegar a una conclusión. Esa frase va dirigida a la persona que tiene tu informe, y más arriba está citada palabra por palabra.
- Guarda lo que muestre cómo se escribió el trabajo: borradores, historial de versiones, notas, las lecturas que hiciste. Eso sí es prueba de autoría. Un porcentaje no lo es.
Seguir leyendo