Il tasso di falsi positivi di Turnitin, spiegato
L'obiettivo di Turnitin, inferiore all'1%, riguarda i falsi rilevamenti su documenti umani secondo una regola di rilevamento specifica. Spieghiamo la soglia del 20%, i test descritti dal fornitore e perché né un punteggio alto né uno basso risolvono la questione dell'autore.
Team HumanPen
· 5 min di lettura
Cosa dice ufficialmente Turnitin sul tasso di falsi positivi
Turnitin dichiara il target direttamente nella sua documentazione: "We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Puntiamo a migliorare l'efficacia del rilevatore e a mantenere sotto l'1% il tasso di testi interamente umani classificati per errore come generati da IA, con una condizione di rilevamento del documento superiore al 20% di scrittura segnalata come IA.)
La condizione del 20% riguarda il risultato del rilevatore, non una quantità di testo IA già accertata nel lavoro. Il white paper di agosto 2024 di Turnitin descrive una regola per i documenti: più del 20% dei punteggi delle frasi supera una soglia del modello. Il test dei falsi positivi usa lavori che il fornitore descrive come interamente umani. L'errore contato è il superamento di quella soglia di rilevamento da parte di un lavoro umano.
Il tasso di falsi positivi a livello di documento indica quanto spesso i documenti umani attivano la regola di rilevamento. Non fornisce la probabilità che un lavoro già segnalato sia umano. Le due domande invertono la condizione, e il solo risultato del test non risponde alla seconda. Anche un punteggio alto richiede una verifica: un punteggio AI Turnitin del 100% può comunque essere umano?
La convalida su oltre 700.000 elaborati
Le FAQ di Turnitin descrivono i test alla base dell'obiettivo: "To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate." (Per rafforzare il nostro framework di test e diagnosticare le tendenze statistiche dei falsi positivi, prima di ogni aggiornamento o rilascio di un nuovo modello, eseguiamo test su oltre 700.000 articoli accademici aggiuntivi che sono stati scritti prima del rilascio di ChatGPT per convalidare ulteriormente il nostro tasso di falsi positivi inferiore all'1%.)
La dichiarazione descrive un ampio corpus, colloca i lavori prima del rilascio di ChatGPT e dice che i test precedono ogni aggiornamento o nuovo modello. Non dice che vengano raccolti nuovi lavori per ogni test. Il white paper di agosto 2024 descrive separatamente come interamente umano un insieme di dati precedente al 2019 usato per uno stress test.
Quando citi il tasso, indica anche la soglia di rilevamento e il corpus di test. Né la dimensione né l'età del corpus trasformano il risultato in una garanzia per ogni disciplina, stile di scrittura o singolo elaborato.
Per mantenere basso il tasso, l'azienda accetta mancati rilevamenti
La parte più importante della documentazione non è il target dell'1% in sé. È il compromesso che Turnitin accetta esplicitamente per raggiungerlo. L'affermazione completa recita: "In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Per mantenere questo basso tasso dell'1% per i falsi positivi, c'è la possibilità che potremmo non rilevare del testo scritto da AI in un documento. Siamo a nostro agio con questo perché non vogliamo evidenziare erroneamente testo scritto da umani come scritto da AI. Per esempio, se identifichiamo che il 50% di un documento è probabilmente scritto da uno strumento AI, potrebbe contenere fino al 65% di scrittura AI.)
L'azienda esplicita il compromesso: accetta di non rilevare parte del testo IA per ridurre il rischio di segnalare erroneamente testo umano. Questo spiega la scelta progettuale, ma non indica quale errore sia avvenuto in un singolo report.
L'esempio del 50% e del 65% illustra una possibile sottostima. Non è una formula di conversione, un limite superiore per altri documenti o la prova che ogni errore vada nella stessa direzione. La stessa documentazione riconosce che un testo umano può essere erroneamente classificato come generato da IA.
Come interpretare il numero
Una volta che mantieni il qualificatore attaccato, il "tasso di falsi positivi" diventa uno strumento più preciso della versione da titolo. Ecco cosa implicano effettivamente i numeri documentati.
Primo, distingui la percentuale IA riportata dall'autore effettivo. Il limite del 20% fa parte di una regola di rilevamento. Anche un lavoro interamente umano può superarlo: è proprio il falso positivo che il test deve contare.
Secondo, i mancati rilevamenti di testo AI fanno parte del design. Poiché il sistema si sintonizza contro i falsi positivi, del testo AI scivola attraverso. Un punteggio riportato che non è alto non significa in modo affidabile che il documento sia interamente umano. Può significare che il contenuto AI è stato sottostimato.
Terzo, accettare di non rilevare parte del testo IA non dimostra che un punteggio alto sia più affidabile nel tuo caso. L'esempio citato non quantifica l'affidabilità di un punteggio dell'80%. Occorre comunque esaminare i passaggi e le prove di come sono stati scritti.
Un punteggio basso non prova che l'autore sia umano, e uno alto non dimostra una violazione accademica. Il compromesso citato non confronta da solo la frequenza dei mancati rilevamenti con quella dei falsi positivi nel tuo contesto. Vedi cosa viene detto al tuo istruttore di fare quando la tua percentuale AI è alta.
Cosa fare se vieni segnalato
Le linee guida stesse di Turnitin collocano il punteggio all'interno di un quadro decisionale più ampio. La documentazione afferma: "Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student." (Il nostro modello di rilevamento della scrittura AI potrebbe non essere sempre accurato (potrebbe identificare erroneamente testo scritto da umani, generato da AI e parafrasato da AI), quindi non dovrebbe essere usato come unica base per azioni avverse contro uno studente.)
Prosegue: "It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred." (Occorre un'ulteriore verifica e il giudizio umano congiuntamente all'applicazione da parte di un'organizzazione delle sue specifiche politiche accademiche per determinare se si è verificata una violazione accademica.)
Questo è il quadro in cui studenti ed educatori dovrebbero operare. La percentuale è un dato. Il verdetto è una decisione presa da umani: l'istruttore, il dipartimento, l'istituzione, applicando le loro proprie politiche accademiche. Turnitin stessa dice che il punteggio non dovrebbe portare da solo la decisione. L'azienda gestisce anche un canale per l'errore stesso: come segnalare un falso positivo a Turnitin.
Se non sei d'accordo con un punteggio, la strada documentata è trattare il numero come un dato e sollevarlo con la persona che ha il contesto accademico – il tuo istruttore. Questo è il passo che i documenti ufficiali descrivono, ed è il passo più coerente con la cornice stessa dell'azienda. Se questo non risolve, come fare appello a una segnalazione AI falsa, e quali prove la tua università accetterà stabilisce cosa viene dopo.
Conserva il report originale e la documentazione del processo di scrittura per quella discussione. Se in seguito decidi di rivedere il documento, il flusso di HumanPen basato sul report interviene sui passaggi segnalati; non stabilisce se la segnalazione originale fosse corretta.
CONTINUA A LEGGERE
Turnitin rileva Claude, Copilot o Gemini?
10 min di lettura
Report TurnitinGli studenti possono vedere il loro punteggio IA di Turnitin? Vista dello studente rispetto a quella del docente
6 min di lettura
Report TurnitinTurnitin conserva il tuo elaborato? Cosa dicono davvero le FAQ
5 min di lettura