Il 4% di falsi positivi per frase di Turnitin: cosa significava nel 2023
La spiegazione di Turnitin del giugno 2023 indicava circa il 4% a livello di frase. L'obiettivo inferiore all'1% per documento misura altro. Il 20% è una soglia di rilevamento, non il requisito che il testo contenga davvero scrittura IA; nessuna delle due cifre decide chi abbia scritto un singolo passaggio.
Team HumanPen
· 5 min di lettura
A cosa si riferisce davvero il 4%
La spiegazione di Turnitin del giugno 2023 descriveva come potenzialmente umane circa il 4% delle frasi già evidenziate come scritte dall'IA. È una statistica sulle frasi segnalate, non una probabilità calibrata per una frase specifica del tuo report attuale. Non è neppure la percentuale di tutte le frasi umane che verranno segnalate.
Annie Chechitelli, Chief Product Officer di Turnitin, lo spiegava così nel giugno 2023:
«Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content.» (Il nostro tasso di falsi positivi a livello di frase è intorno al 4%. Significa che c'è una probabilità del 4% che una frase specifica evidenziata come scritta dall'IA sia in realtà scritta da un essere umano. Il fenomeno è più frequente nei documenti che contengono un mix di contenuti scritti da esseri umani e dall'IA, in particolare nei passaggi tra gli uni e gli altri.)
La condizione è che la frase sia già stata evidenziata. Il tasso di falsi positivi per documento misura invece quanto spesso i documenti umani attivano una regola di rilevamento. I denominatori sono diversi: non si può convertire una percentuale nell'altra.
Il tasso a livello di documento è un numero diverso
Lo stesso post del giugno 2023 fornisce anche una cifra per documento:
«Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing.» (Il nostro tasso di falsi positivi per documento, cioè identificare erroneamente testo interamente umano come generato dall'IA, è inferiore all'1% quando il criterio di classificazione richiede un risultato di rilevamento della scrittura IA pari o superiore al 20%.)
La formulazione può trarre in inganno: il 20% si riferisce a ciò che indica il rilevatore, non a una quantità nota di scrittura IA realmente presente. Il white paper dell'agosto 2024 di Turnitin spiega una regola di classificazione del documento in cui oltre il 20% dei punteggi delle frasi supera una soglia del modello. Verifica i falsi positivi su elaborati studenteschi anteriori al 2019, descritti come interamente umani. Un falso positivo è uno di questi elaborati umani che supera la soglia di rilevamento.
Cosa dicono i tassi di un elaborato scritto da te
Gli elaborati interamente umani sono proprio ciò che serve a un test dei falsi positivi per documento. La soglia del 20% nella regola di rilevamento non li esclude dal test.
Il post del 2023 dice che le frasi segnalate per errore sono più frequenti nei documenti misti, soprattutto nei passaggi tra testo umano e testo IA. Più frequenti non significa esclusive. Non esclude segnalazioni errate in lavori interamente umani.
L'obiettivo inferiore all'1% descrive la frequenza con cui i documenti umani attivano la regola indicata nelle condizioni di test del fornitore. Non significa che un elaborato segnalato abbia meno dell'1% di probabilità di essere umano. Sarebbe un'inversione della condizione misurata.
Entrambe le cifre aiutano a capire che gli errori sono possibili. Nessuna identifica l'autore del tuo passaggio specifico. Esamina il testo segnalato e il processo di scrittura invece di usare un tasso come verdetto.
Dove si concentrano i segnali sbagliati
Turnitin ha fornito un dato preciso su dove compaiono queste frasi segnalate a torto:
«As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing.» (Come spiegato nel mio articolo precedente, esiste una correlazione tra queste frasi e la loro vicinanza, nel documento, alla scrittura IA effettiva. Nel 54% dei casi, queste frasi si trovano esattamente accanto a scrittura IA effettiva.)
Queste frasi sono quelle scritte da persone ma segnalate erroneamente. Secondo la spiegazione del 2023, il 54% si trovava accanto a vera scrittura IA. È una concentrazione osservata di errori, non una regola valida per ogni falso positivo.
L'osservazione non permette di diagnosticare la causa di una segnalazione nel tuo elaborato. Non dimostra che ci sia testo IA nelle vicinanze, né esclude un errore quando non c'è. Usa i passaggi evidenziati per orientare la verifica; le statistiche sulla vicinanza non stabiliscono la paternità del testo.
Come Turnitin dice che va letto un segnale
Lo stesso post dice chiaramente che un'evidenziazione è un punto di partenza, non un accertamento, e lo dice ai docenti, cioè proprio a chi vuoi che lo legga:
«Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion.» (Considera le frasi evidenziate come aree di interesse, perché si prevede che siano vicine al punto in cui è presente scrittura IA. Ma in una piccola percentuale di casi il modello IA può sbagliare. Quindi usa l'informazione per avviare una conversazione, non per trarre una conclusione.)
Esclude anche la cosa con cui gli studenti più spesso credono di venire misurati. Non esiste un numero da centrare:
«Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score.» (Ricorda che con l'indicatore di scrittura IA non esiste un punteggio «giusto» né un punteggio «obiettivo», proprio come con il Similarity Score.)
Cosa fare con un report che porta due frasi
Niente di tutto questo ti dice se sei nei guai, perché nessun numero pubblicato può farlo. Quello che ti dà è un modo per tenere la conversazione sul report stesso invece che su una percentuale.
- Chiedi quali passaggi, e fatti dare il report invece di uno screenshot. Due frasi evidenziate e un numero a livello di documento sono oggetti diversi. Le evidenziazioni sono l'unica parte con una posizione su cui puoi puntare il dito.
- Chiedi quale tasso viene citato e cosa misura. La soglia del 20% riguarda l'output del rilevatore. Il tasso di falsi positivi per documento si misura su lavori umani; non è la probabilità che il tuo specifico elaborato segnalato sia umano.
- Porta con te l'indicazione dello stesso Turnitin. Dice ai docenti di usare un'evidenziazione per avviare una conversazione, non per arrivare a una conclusione. Quella frase è rivolta alla persona che ha in mano il tuo report, ed è citata sopra parola per parola.
- Tieni quello che mostra come è stato scritto l'elaborato — bozze, cronologia delle versioni, appunti, le letture che hai fatto. Questa è una prova di paternità. Una percentuale non lo è.
CONTINUA A LEGGERE