Turnitin rileva i testi di Mistral AI? Cosa dice la documentazione
Mistral compare nell'elenco dei modelli che Turnitin sa rilevare. Ma il rilevamento non è un semplice sì o no. Ecco cosa dice davvero la documentazione su come il sistema elabora il tuo testo, cosa può mancare e cosa succede quando i modelli vengono aggiornati.
Team HumanPen
· 5 min di lettura
Mistral è nell'elenco di modelli pubblicato
Turnitin mantiene un elenco pubblicato dei modelli di cui il modello di rilevamento della scrittura IA riesce a identificare i risultati. Nell'elenco ci sono GPT, Gemini, Claude, LLaMA, Mistral, Deepseek, Nova, Grok, o1-mini e anche gli strumenti basati su questi LLM. LLaMA sta accanto a Mistral per lo stesso motivo: entrambi sono a pesi aperti, e Turnitin rileva LLaMA segue la stessa lettura. La formulazione è lineare: il modello di rilevamento della scrittura IA di Turnitin per le consegne in inglese può rilevare i contenuti di questi modelli.
La documentazione segnala anche: «We will continue to expand our detection capabilities to other models in the future.» (continueremo ad ampliare le nostre capacità di rilevamento ad altri modelli in futuro). Quindi l'elenco non è fissato una volta per tutte: si allunga con l'uscita di nuovi modelli e con l'aggiornamento del sistema di rilevamento, che impara a riconoscerne i risultati.
Nel caso specifico di Mistral, la risposta a «Turnitin lo rileva?» è sì: è nell'elenco. Ma ciò che «rilevare» significa in pratica rimanda a un processo più sfumato.
Come funziona davvero il rilevamento
Capire cosa succede quando consegni un documento aiuta a spiegare perché i risultati sono quelli che sono. Ecco il meccanismo descritto da Turnitin:
«When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando un elaborato viene inviato a Turnitin, le frasi del testo inviato vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia probabilmente umano o generato da IA. Ogni frase idonea all'interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in un punteggio unico. Questi punteggi di frase vengono ulteriormente aggregati e usati per calcolare il punteggio complessivo di scrittura IA del documento.)
Il sistema non cerca un singolo elemento rivelatore. Suddivide il tuo testo in sezioni, assegna a ogni sezione un punteggio di probabilità IA, riunisce i punteggi delle frasi sovrapposte e aggrega tutto in un'unica percentuale a livello di documento.
La documentazione dice anche chiaramente cosa il modello non fa. Non si basa su metriche con un nome preciso come burstiness o perplexity, una smentita che analizziamo in Turnitin usa perplexity e burstiness per rilevare l'IA: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (il nostro modello non è programmato esplicitamente per valutare segnali specifici come «burstiness», «perplexity» o altre metriche singole a volte citate nelle discussioni pubbliche). Il modello impara invece schemi statistici dai dati di addestramento. I classificatori sono addestrati a rilevare differenze nella probabilità delle parole e sanno riconoscere le sequenze di probabilità tipiche di chi scrive come un essere umano.
Questo significa che il rilevamento è probabilistico, non deterministico. Il punteggio riflette la fiducia del modello nel fatto che un testo assomigli a schemi generati dall'IA, non un giudizio binario netto.
Cosa può non vedere il rilevatore
Essere nell'elenco dei modelli rilevabili non significa che ogni frase generata dall'IA venga beccata. Turnitin dà la priorità al contenimento dei falsi positivi, e questo compromesso ha un costo dall'altra parte.
«In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing.» (Per mantenere questo basso tasso dell'1% di falsi positivi, è possibile che ci sfugga una parte del testo scritto con l'IA in un documento. Per noi va bene così, perché non vogliamo segnalare per errore come scritto dall'IA un testo scritto da un essere umano. Per esempio, se rileviamo che il 50% di un documento è stato probabilmente scritto con uno strumento di IA, il documento potrebbe contenere fino al 65% di scrittura IA.)
Un documento inviato con testo generato da Mistral può quindi ricevere un punteggio inferiore alla percentuale reale di contenuto IA. Il rilevatore può indicare il 50% come scritto dall'IA quando la quota reale è più vicina al 65%. È una scelta precisa: il sistema tende a non segnalare il testo umano, il che significa che una parte del testo IA passerà senza essere segnalata.
Questo scarto conta se cerchi di capire perché un documento con contenuto IA noto abbia ricevuto un punteggio più basso del previsto. I calcoli dietro questo obiettivo dell'1% sono spiegati passo per passo in cosa significa un tasso di falsi positivi dell'1%.
Le capacità di rilevamento cambiano nel tempo
Il modello che oggi rileva i testi di Mistral non è necessariamente lo stesso che sarà in funzione il mese prossimo. La documentazione di Turnitin lo riconosce:
«As we iterate and develop our model further to better detect newer LLMs, it is likely that our detection capabilities will also change, affecting the AI percentage.. However, for a submitted document, the AI percentage will change only if it's re-submitted again to be processed.» (Man mano che perfezioniamo il nostro modello per rilevare meglio gli LLM più recenti, è probabile che cambino anche le nostre capacità di rilevamento, con effetti sulla percentuale IA. Tuttavia, per un documento già inviato, la percentuale IA cambierà soltanto se il documento viene inviato di nuovo per essere elaborato.)
Due conseguenze pratiche. Primo: lo stesso documento può ricevere punteggi diversi se viene inviato di nuovo dopo un aggiornamento del modello, ed è per questo che confrontare due report è meglio che confrontare due punteggi. Secondo: una volta elaborato un documento, il punteggio comunicato resta fisso finché il documento non ripassa dal sistema. Se confronti i punteggi nel tempo, le differenze possono riflettere aggiornamenti del modello più che modifiche al documento stesso.
Cosa significa «rilevare Mistral» in pratica
Mistral è una famiglia di modelli, non un prodotto singolo e definito. Gli strumenti costruiti sopra i modelli Mistral, o le versioni ottimizzate di Mistral, rientrano anch'essi nella formulazione di Turnitin «tools based on these LLMs» (gli strumenti basati su questi LLM). Il modello di rilevamento non indica Mistral per nome nel report. Produce un solo punteggio di scrittura IA a livello di documento, basato su schemi statistici, senza scomposizione per modello specifico.
Questo significa che un report non dirà «30% Mistral, 10% GPT». Dirà piuttosto qualcosa come «40% generato dall'IA», cioè un punteggio aggregato. L'elenco dei modelli ti dice quali famiglie di modelli il rilevatore è addestrato a riconoscere, non quale modello specifico ha prodotto quale paragrafo. Ciò che il report mette davvero sulla pagina è spiegato in come leggere un AI Writing Report di Turnitin.
Cosa significa per te
Se lavori con testo generato da Mistral e ti serve capire come lo tratterà Turnitin, ecco il riassunto:
- Sì, Mistral è rilevabile. Compare nell'elenco di modelli pubblicato, e anche gli strumenti basati su Mistral sono coperti.
- Il rilevamento è probabilistico. Il sistema suddivide il testo in sezioni, assegna a ogni sezione un punteggio di probabilità IA e aggrega i punteggi in un'unica percentuale. Non usa burstiness né perplexity.
- Una parte del testo IA non verrà vista. Per tenere i falsi positivi sotto l'1% nei documenti con più del 20% di scrittura IA, il rilevatore può contare meno del dovuto il contenuto IA reale.
- I punteggi possono cambiare. Se il modello viene aggiornato e il documento viene inviato di nuovo, il punteggio può spostarsi. Un punteggio di un invio precedente resta fisso finché il documento non viene elaborato di nuovo.
- Nessuna scomposizione per modello. Il report mostra una percentuale IA aggregata, non un'attribuzione per singolo modello.
I passaggi idonei possono essere rielaborati gratuitamente.
CONTINUA A LEGGERE