Parafrasear bajó la similitud, pero subió la puntuación de IA: por qué pasa

Parafrasear es el recurso al que casi todos recurren para bajar la puntuación de similitud en Turnitin. Y hay quien descubre que, después de parafrasear, la similitud bajó… pero la puntuación de detección de escritura por IA subió. No es un fallo del sistema. Las dos puntuaciones miden cosas completamente distintas, y cambiar el texto para arreglar una puede mover la otra en la dirección equivocada.

Equipo de HumanPen

· 6 min de lectura

La respuesta corta: dos puntuaciones, dos sistemas, ninguna conexión

La puntuación de similitud y la puntuación de detección de escritura por IA son dos mediciones distintas que no se influyen entre sí. Turnitin lo dice sin rodeos: «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (La puntuación de similitud y el porcentaje de detección de escritura por IA son totalmente independientes y no se influyen mutuamente.)

Cuando parafraseas para bajar el porcentaje de similitud, no hay ningún mecanismo que arrastre también la puntuación de IA hacia abajo. Las dos cifras pueden moverse en direcciones opuestas, y de hecho lo hacen a menudo. Parafrasear cambia las palabras del documento y reduce las coincidencias de cadenas de texto en la base de datos de similitud. Esos mismos cambios pueden alterar los patrones de probabilidad de las palabras de una forma que haga más probable que el detector de IA marque el texto. El resultado es justo lo que mucha gente se encuentra: la similitud baja, la puntuación de IA sube.

Qué busca realmente cada sistema

Para entender por qué ocurre esto hay que ver qué mide cada sistema. El informe de similitud compara el texto que entregas con una base de datos de contenido ya existente. Como explica Turnitin, «The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking.» (La puntuación de similitud indica el porcentaje de texto coincidente encontrado en el documento entregado, al compararlo con la amplia colección de contenido que Turnitin usa para la revisión de similitud.) Parafrasear reduce esas coincidencias porque estás cambiando justo las cadenas de texto que el sistema busca.

El detector de escritura por IA hace algo fundamentalmente distinto. No busca texto coincidente: analiza los patrones estadísticos de las palabras que eliges. Así describe Turnitin el proceso: «When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se entrega un trabajo a Turnitin, las oraciones del envío se extraen y se dividen en secciones superpuestas para el análisis de predicción. Cada sección la clasifica el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea humano o generado por IA. Cada oración calificable dentro de esas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Esas puntuaciones por oración se vuelven a agregar y se usan para calcular la puntuación general de escritura por IA del documento.)

El sistema de similitud busca cadenas de texto que ya existen en otra parte. El sistema de IA busca patrones de probabilidad en cómo se eligen las palabras. Parafrasear cambia las cadenas, lo que ayuda a la similitud, pero también cambia los patrones de probabilidad, y eso puede perjudicar la puntuación de IA. Son dos objetivos distintos, y acertar en uno no significa acertar en el otro.

La ironía: parafrasear sin aportar ideas nuevas es un detonante conocido de falsos positivos

Aquí es donde la situación se vuelve especialmente frustrante. La propia documentación de Turnitin menciona el parafraseo entre las características de los textos que pueden generar falsos positivos. El texto completo dice: «Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.» (A veces los falsos positivos, es decir, marcar como generado por IA un texto escrito por una persona, pueden darse en contenido con poca variación estructural, en texto que se repite literalmente o en texto que se ha parafraseado sin desarrollar ideas nuevas.)

Turnitin añade a continuación este consejo: «If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (Si nuestro indicador muestra una mayor cantidad de escritura por IA en ese tipo de texto, te recomendamos tenerlo en cuenta al mirar el porcentaje indicado.)

Aquí está el fondo del problema. Cuando parafraseas para bajar la similitud, la revisión suele quedarse dentro de las ideas que ya están en la página. Y eso es exactamente el tipo de texto «paraphrased without developing new ideas» (parafraseado sin desarrollar ideas nuevas) que Turnitin señala como propenso a falsos positivos. No estás añadiendo análisis nuevo, ni argumentos nuevos, ni evidencia nueva. Las ideas siguen siendo las mismas, la estructura suele seguir parecida, y el texto encaja ahora en un perfil que el detector de IA asocia con contenido generado por máquina. Los cambios que hiciste para evitar coincidencias de similitud pueden haber producido un texto que, estadísticamente, se parece más a la salida de una IA, no menos. Por qué parafrasear hace subir tu puntuación de IA en Turnitin recorre el mismo mecanismo desde el otro extremo.

Probabilidad de las palabras: por qué una reescritura puede mover la puntuación en la dirección equivocada

Una pregunta frecuente es si el detector de IA mide cosas como la «perplexity» o la «burstiness», términos que circulan en las discusiones sobre detección de IA; eso lo tratamos aparte en si Turnitin usa perplexity y burstiness. Turnitin lo aborda directamente: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (Nuestro modelo no está programado explícitamente para evaluar señales concretas como la burstiness, la perplexity u otras métricas individuales que a veces se mencionan en debates públicos.) En la frase siguiente añaden: «Instead, it learns statistical patterns from our training data.» (En cambio, aprende patrones estadísticos a partir de nuestros datos de entrenamiento.)

Esto no significa que la probabilidad de las palabras sea irrelevante. La misma documentación sigue con una aclaración clave: «Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.» (Nuestros clasificadores están entrenados para detectar esas diferencias en la probabilidad de las palabras y conocen bien las secuencias de probabilidad características de quienes escriben como humanos.)

En conjunto, estas dos afirmaciones dicen algo importante. El modelo no calcula la perplexity como una métrica con nombre propio, pero está entrenado con patrones de probabilidad de las palabras. Cuando una reescritura cae en la opción más obvia en cada posición, puede estar eligiendo la palabra más predecible estadísticamente en ese punto. Si el original era una elección poco habitual y lo que la sustituye es la más común, el patrón de probabilidad se vuelve más predecible, no menos. Para un clasificador entrenado con probabilidad de palabras, las secuencias más predecibles pueden parecerse más a texto generado por IA. Este es el mecanismo que hay detrás de la paradoja: parafrasear hace que el texto se parezca menos a las fuentes existentes, pero las palabras concretas elegidas pueden volverlo más predecible estadísticamente, justo lo contrario de lo que baja una puntuación de IA.

Qué significa esto en la práctica

La conclusión práctica es que bajar la similitud y bajar la puntuación de IA son dos objetivos distintos. Exigen cambios diferentes en el texto, y los cambios que ayudan a uno pueden perjudicar al otro. Parafrasear sin más, sobre todo si la revisión se queda dentro de las ideas que ya están en la página, es justo el tipo de enfoque que baja la similitud y a la vez puede subir la puntuación de IA. Esa diferencia es también aquello en lo que realmente se distinguen las dos categorías de herramientas.

El informe de similitud va de si tus cadenas de texto coinciden con contenido existente. El informe de IA va de si tus patrones de probabilidad de las palabras se parecen a texto generado por máquina. Intentar resolver ambas cosas con la misma pasada de edición, sobre todo una que se queda dentro de las ideas ya presentes en la página, es donde aparece el conflicto. Si tu puntuación de IA subió después de parafrasear para bajar la similitud, lo más probable es que el parafraseo cambiara tu texto de formas que el detector de IA lee como más predecibles, y que además encaje en el perfil de falso positivo de «paraphrased without developing new ideas.» (parafraseado sin desarrollar ideas nuevas).

Resumen de qué hacer

Esto es lo que conviene sacar en limpio:

  1. La puntuación de similitud y la puntuación de IA son mediciones independientes. Bajar una no baja la otra.
  2. El sistema de similitud busca cadenas de texto coincidentes. El sistema de IA analiza patrones de probabilidad de las palabras. Son señales distintas.
  3. «Paraphrased without developing new ideas» (parafraseado sin desarrollar ideas nuevas) está citado expresamente por Turnitin como detonante de falsos positivos. El criterio es si apareció análisis nuevo, no qué edición produjo la frase.
  4. El modelo de IA no está programado para la burstiness o la perplexity como métricas con nombre propio, pero está entrenado con probabilidad de las palabras. Una pasada que cae en la opción más predecible en cada posición puede hacer que el texto parezca más generado por máquina.
  5. Bajar la similitud y bajar la puntuación de IA son objetivos separados. Parafrasear sin más puede ayudar a uno y perjudicar al otro.

Cuando los pasajes que cumplen los requisitos pueden volver a procesarse sin coste, tienes margen para iterar, que es justo para lo que sirve importar el informe de Turnitin. La clave está en tratar las dos puntuaciones como problemas distintos que necesitan enfoques distintos.

Seguir leyendo