Quanto è affidabile un punteggio IA di Turnitin sui documenti brevi?

Se il tuo elaborato conta solo poche centinaia di parole, un punteggio IA di Turnitin si comporta in modo diverso rispetto a un saggio lungo. La stessa Turnitin dice che la previsione sui documenti brevi è in gran parte «all or nothing» (tutto o niente), perché viene esaminato un solo segmento. Sotto le 300 parole non c'è proprio alcun punteggio: i requisiti del file fissano quella soglia. Questo articolo spiega le dichiarazioni ufficiali, perché un contenuto misto può sembrare interamente generato dall'IA e come leggere il punteggio di un documento breve senza reagire in modo eccessivo.

Team HumanPen

· 4 min di lettura

Cosa dice Turnitin sugli elaborati brevi

Le parole della stessa Turnitin sui documenti brevi sono dirette: «In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap.» (Nei documenti più brevi, dove ci sono solo poche centinaia di parole, la previsione sarà per lo più «tutto o niente», perché facciamo la previsione su un singolo segmento, senza la possibilità di sovrapporre.)

Quella frase arriva dalle domande frequenti di Turnitin sul rilevamento della scrittura IA. Descrive cosa accade alla previsione quando il testo non basta: il modello non resta a metà, prende una posizione netta. Un elaborato breve tende a essere giudicato nel suo insieme, non frase per frase.

Questo conta perché quasi tutto ciò che le persone danno per scontato sui punteggi IA deriva dai saggi lunghi. Su un documento lungo il rilevatore lavora su molti segmenti e la percentuale può riflettere una commistione. Su un documento breve c'è meno spazio per questo genere di sfumature.

Perché viene fuori tutto o niente

Il motivo sta nel meccanismo. Turnitin lo descrive così: «sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated.» (Le frasi dell'elaborato vengono estratte e suddivise in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera di un essere umano o generato dall'IA.)

In un elaborato lungo, queste sezioni sovrapposte danno al modello molte occasioni di guardare le stesse frasi da angolazioni diverse. I punteggi delle singole frasi vengono raccolti e poi aggregati nel punteggio del documento, e questo smussa il risultato — la stessa aggregazione descritta in cosa controlla il rilevamento IA di Turnitin e come nasce il punteggio.

Con solo poche centinaia di parole c'è, in pratica, una sola sezione. Nessuna sovrapposizione, nessuna raccolta di più punti di vista. Il punteggio del documento eredita il giudizio di un'unica classificazione, ed è per questo che la previsione esce più vicina al «tutto» o al «niente» che a qualcosa nel mezzo.

Un contenuto misto può essere valutato come interamente IA

La conseguenza è scritta nella frase successiva di Turnitin: «This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.» (Questo significa che una parte del testo che mescola contenuti generati dall'IA e contenuti originali può essere segnalata come interamente generata dall'IA.)

Quindi, in un elaborato breve, una pagina scritta in gran parte da te che contiene un passaggio generato dall'IA può essere valutata come se tutto fosse opera dell'IA. Il modello non ha abbastanza sezioni per separare le due cose. Non sta dicendo che ogni parte del documento sia stata generata dall'IA; sta dicendo che la previsione si è ridotta a un solo giudizio — una delle strade per cui un punteggio IA Turnitin del 100% può comunque essere scritto da un essere umano.

Ecco perché due elaborati brevi con la stessa percentuale reale di testo IA possono finire per apparire completamente diversi. Il punteggio non è una misura precisa di quanto del documento sia IA. È una previsione fatta su materiale limitato.

Sotto le 300 parole non c'è alcun punteggio da leggere

C'è una frase che in questi casi viene citata spesso, e da dove arriva fa la differenza. Turnitin ha scritto, in una nota di rilascio datata 15 dicembre 2023: «our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.» (La nostra accuratezza aumenta con un po' più di testo, quindi gli elaborati con meno di 300 parole possono portare a un punteggio di scrittura IA probabilmente meno accurato.) Quella nota s'intitola «AI writing detection processing bug fix,» (correzione di un bug nell'elaborazione del rilevamento della scrittura IA), il paragrafo sopra la frase dice «This issue has now been resolved,» (questo problema è stato ora risolto), e il bug era che gli elaborati sotto le 300 parole venivano comunque processati. La frase descrive i report generati tra il 6 e il 15 dicembre 2023.

Il che la rende difficile da applicare oggi. Con il bug risolto, un elaborato sotto le 300 parole di prosa non riceve un punteggio meno accurato. Non riceve alcun punteggio. Gli attuali requisiti del file dicono che un file «must have at least 300 words of prose text in a long-form writing format,» (deve contenere almeno 300 parole di testo in prosa in un formato di scrittura esteso), quindi se sei sotto quella soglia e ti prepari a una percentuale inaffidabile, quello che vedrai in realtà è nessun AI Writing Report. Quanto di un elaborato conti come testo è un'altra questione, trattata in cosa si intende per testo idoneo nel rilevamento IA di Turnitin.

Se hai davanti un elaborato molto breve, il numero nel report va trattato come un indicatore approssimativo, non come una misurazione.

Come leggere il punteggio di un documento breve

L'indicazione di Turnitin per chiunque legga un punteggio IA è la stessa, che il documento sia lungo o breve: «the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors.» (La percentuale sull'indicatore di scrittura IA non deve essere usata come unica base per prendere provvedimenti né come misura di valutazione definitiva da parte dei docenti.)

Sui documenti brevi questo conta ancora di più, perché il punteggio è sia tutto o niente sia meno accurato. Una reazione pesante al punteggio di un documento breve tratta una previsione approssimativa come se fosse un dato misurato. Turnitin dice anche che il punteggio «is not meant to provide definitive answers in isolation,» (non è pensato per fornire risposte definitive da solo), e che chi lo legge dovrebbe bilanciare il numero con la conoscenza personale dello studente e del suo lavoro. Le pagine rivolte ai docenti vanno oltre e indicano cosa viene detto di fare a un docente quando la percentuale IA è alta.

La lettura pratica è semplice. Un punteggio basso su un elaborato breve merita una domanda; anche un punteggio alto su un elaborato breve la merita, prima che qualcuno lo tratti come un verdetto sull'intero testo.

CONTINUA A LEGGERE