¿Detecta Turnitin los textos de Mistral AI? Lo que dice la documentación

Mistral aparece en la lista de modelos detectables de Turnitin. Pero la detección no es una simple marca de sí o no. Esto es lo que la documentación dice realmente sobre cómo procesa el sistema tu texto, qué puede pasar por alto y qué ocurre cuando los modelos se actualizan.

Equipo de HumanPen

· 5 min de lectura

Mistral está en la lista publicada de modelos

Turnitin mantiene una lista publicada de los modelos cuyos resultados puede identificar su modelo de detección de escritura con IA. En esa lista están GPT, Gemini, Claude, LLaMA, Mistral, Deepseek, Nova, Grok, o1-mini y también las herramientas basadas en estos LLM. LLaMA aparece junto a Mistral por el mismo motivo: ambos son de pesos abiertos, y si Turnitin detecta LLaMA hace la misma lectura. La formulación es directa: el modelo de detección de escritura con IA de Turnitin para envíos en inglés puede detectar contenido de estos modelos.

La documentación señala además: «We will continue to expand our detection capabilities to other models in the future.» (seguiremos ampliando nuestras capacidades de detección a otros modelos en el futuro). Por tanto, la lista no está cerrada: crece a medida que se lanzan nuevos modelos y el sistema de detección se actualiza para reconocer sus resultados.

En el caso concreto de Mistral, la respuesta a «¿detecta Turnitin sus textos?» es sí: está en la lista. Pero lo que «detectar» significa en la práctica es un proceso con más matices.

Cómo funciona realmente la detección

Entender qué ocurre cuando envías un documento ayuda a explicar por qué los resultados son como son. Este es el mecanismo que describe Turnitin:

«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Cuando se envía un trabajo a Turnitin, las oraciones del envío se extraen y se segmentan en secciones superpuestas para el análisis de predicción. Cada sección es clasificada por el modelo de detección de IA y recibe un valor entre 0 y 1, que indica la probabilidad de que el texto sea probablemente humano o generado por IA. Cada oración calificable dentro de estas secciones hereda la puntuación de la sección. Como las secciones se superponen, algunas oraciones pueden tener varias puntuaciones, que luego se agrupan en una sola. Estas puntuaciones por oración se agregan después y se usan para calcular la puntuación global de escritura con IA del documento.)

El sistema no busca un único rasgo delator. Segmenta tu texto, puntúa cada segmento según su probabilidad de ser IA, agrupa las puntuaciones de las oraciones superpuestas y lo resume todo en un único porcentaje a nivel de documento.

La documentación también es explícita sobre lo que el modelo no hace. No se apoya en métricas con nombre propio como la burstiness o la perplexity, una negativa que analizamos en si Turnitin usa perplexity y burstiness para detectar IA: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (nuestro modelo no está programado explícitamente para evaluar señales concretas como «burstiness», «perplexity» u otras métricas individuales que a veces se mencionan en debates públicos). En cambio, el modelo aprende patrones estadísticos a partir de los datos de entrenamiento. Los clasificadores se entrenan para detectar diferencias en la probabilidad de las palabras y manejan bien las secuencias concretas de probabilidad de palabras propias de quien escribe como humano.

Esto significa que la detección es probabilística, no determinista. La puntuación refleja la confianza del modelo en que un texto se parece a los patrones generados por IA, no un juicio binario tajante.

Qué puede pasar por alto el detector

Estar en la lista de modelos detectables no significa que todas las oraciones generadas por IA queden atrapadas. Turnitin prioriza mantener bajos los falsos positivos, y ese equilibrio tiene un coste en el otro lado.

«In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing.» (Para mantener esta tasa baja del 1% de falsos positivos, existe la posibilidad de que pasemos por alto parte del texto escrito con IA en un documento. Estamos cómodos con eso porque no queremos marcar erróneamente como escrito por IA un texto escrito por una persona. Por ejemplo, si identificamos que el 50% de un documento probablemente fue escrito con una herramienta de IA, podría contener hasta un 65% de escritura con IA.)

Por tanto, un documento enviado con texto generado por Mistral puede recibir una puntuación inferior al porcentaje real de contenido de IA. El detector puede identificar un 50% como escrito por IA cuando la cifra real se acerca más al 65%. Esto es intencionado: el sistema se inclina por no marcar texto humano, lo que significa que algo de texto de IA pasará sin ser marcado.

Esta brecha importa si intentas entender por qué un documento con contenido de IA conocido recibió una puntuación menor de lo esperado. La aritmética detrás de ese objetivo del 1% se desarrolla en qué significa una tasa de falsos positivos del 1%.

Las capacidades de detección cambian con el tiempo

El modelo que detecta hoy los textos de Mistral no es necesariamente el mismo que estará funcionando el mes que viene. La documentación de Turnitin lo reconoce:

«As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage.. However, for a submitted document, the AI percentage will change only if it's re-submitted again to be processed.» (A medida que sigamos iterando y desarrollando nuestro modelo para detectar mejor los LLM más nuevos, es probable que nuestras capacidades de detección también cambien, lo que afectará al porcentaje de IA. Sin embargo, en el caso de un documento ya enviado, el porcentaje de IA solo cambiará si vuelve a enviarse para ser procesado.)

De aquí salen dos conclusiones prácticas. Primera: el mismo documento podría recibir puntuaciones distintas si se vuelve a enviar tras una actualización del modelo, y por eso comparar dos informes es mejor que comparar dos puntuaciones. Segunda: una vez procesado un documento, la puntuación informada se mantiene fija salvo que vuelva a pasar por el sistema. Si comparas puntuaciones a lo largo del tiempo, las diferencias pueden reflejar actualizaciones del modelo en lugar de cambios en el propio documento.

Qué significa la «detección de Mistral» en la práctica

Mistral es una familia de modelos, no un producto único y fijo. Las herramientas construidas sobre los modelos de Mistral, o las versiones ajustadas de Mistral, también entran en la formulación de Turnitin "tools based on these LLMs" (herramientas basadas en estos LLM). El modelo de detección no identifica Mistral por su nombre en el informe. Produce una sola puntuación de escritura con IA a nivel de documento basada en patrones estadísticos, sin desglose por modelo concreto.

Esto significa que un informe no dirá «30% Mistral, 10% GPT». Dirá algo así como «40% generado por IA», es decir, una puntuación agregada. La lista de modelos te dice qué familias de modelos está entrenado para reconocer el detector, no qué modelo concreto produjo qué párrafo. Lo que el informe sí pone en la página se explica en cómo leer un AI Writing Report de Turnitin.

Qué significa esto para ti

Si trabajas con texto generado por Mistral y necesitas entender cómo lo tratará Turnitin, aquí tienes el resumen:

  • Sí, Mistral es detectable. Aparece en la lista publicada de modelos, y las herramientas basadas en Mistral también están cubiertas.
  • La detección es probabilística. El sistema segmenta el texto, puntúa cada segmento según su probabilidad de ser IA y agrega las puntuaciones en un solo porcentaje. No usa la burstiness ni la perplexity.
  • Algo de texto de IA quedará sin detectar. Para mantener los falsos positivos por debajo del 1% en documentos con más de 20% de escritura con IA, el detector puede quedarse corto al contar el contenido real de IA.
  • Las puntuaciones pueden cambiar. Si el modelo se actualiza y el documento se vuelve a enviar, la puntuación puede moverse. Una puntuación de un envío anterior se mantiene fija hasta que se vuelva a procesar.
  • Sin desglose por modelo. El informe muestra un porcentaje de IA agregado, no una atribución por modelo.

Los pasajes que cumplen los requisitos pueden volver a procesarse sin coste.

Seguir leyendo