Che cos’è il «testo idoneo» nel rilevamento dell’IA di Turnitin? Una spiegazione dettagliata

Quando Turnitin segnala una percentuale di scrittura IA, quel numero non copre tutto il tuo elaborato. Il modello analizza solo il «testo idoneo», cioè le frasi in prosa con grammatica standard. Le liste, gli elenchi puntati e le strutture che non formano frasi restano fuori. Ecco perché la percentuale e i passaggi evidenziati a volte non coincidono. Ecco cosa dice la documentazione su cosa conta, cosa no e perché è importante.

Team HumanPen

· 5 min di lettura

Che cosa significa «testo idoneo»

Il modello di rilevamento dell’IA di Turnitin non analizza ogni parola di un documento. Lavora su un sottoinsieme preciso del testo, chiamato «testo idoneo». La documentazione lo definisce chiaramente.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Questo testo idoneo comprende solo frasi in prosa, il che significa che analizziamo esclusivamente blocchi di testo scritti in frasi grammaticalmente standard e che non includono altri tipi di scrittura, come le liste, gli elenchi puntati (brevi strutture che non sono frasi) o altre strutture che non sono frasi.)

Il modello cerca quindi prosa: blocchi di testo organizzati in frasi grammaticalmente standard. Tutto ciò che non raggiunge questa soglia resta fuori dall’analisi. Elenchi puntati, elenchi numerati, intestazioni di tabella che non sono frasi complete e altre strutture non in prosa sono esclusi dal perimetro del rilevamento dell’IA.

La stessa documentazione del modello ammette questo limite: "The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures)." (Il modello non rileva in modo affidabile il testo generato dall’IA sotto forma di testo non in prosa o di codice, e non rileva nemmeno la scrittura breve o non convenzionale, come gli elenchi puntati (brevi strutture che non sono frasi).)

Se un documento è ricco di elenchi e povero di prosa, il modello di rilevamento dell’IA ha meno materiale su cui lavorare e il punteggio riportato riflette solo le parti in prosa. C’è anche una soglia minima, perché i requisiti dei file chiedono almeno 300 parole di prosa prima che venga generato un report, ed è proprio questo il punto che approfondisce Turnitin può controllare una tesi intera.

La discrepanza tra percentuale ed evidenziazioni

Uno degli aspetti più confusi del report di rilevamento dell’IA di Turnitin è che la percentuale e i passaggi evidenziati sembrano raccontare cose diverse. La documentazione spiega perché.

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Questo significa che un documento contenente diversi tipi di scrittura comporterebbe una discrepanza tra la percentuale e le evidenziazioni.)

"This percentage is not necessarily the percentage of the entire submission." (Questa percentuale non è necessariamente la percentuale dell’intero elaborato.)

Se il tuo documento è per il 50% prosa e per il 50% elenchi puntati, e il modello segnala come generata dall’IA il 40% della prosa, il report potrebbe mostrare un punteggio IA del 40%. Ma quel 40% si riferisce alla prosa idonea, non all’intero documento. Chi legge il report senza capirlo potrebbe pensare che tutto l’elaborato sia al 40% generato dall’IA, mentre la quota reale sul documento completo è più bassa.

Questa discrepanza non è un bug. È una conseguenza del perimetro del modello. Capirla ti aiuta a leggere il report in modo corretto, e come leggere un report di scrittura IA di Turnitin ti accompagna nel resto della pagina.

Come il modello elabora il testo

Per capire perché il testo idoneo conta, è utile sapere cosa ne fa il modello. La documentazione descrive il meccanismo:

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated." (Quando un elaborato viene inviato a Turnitin, le frasi dell’invio vengono estratte e segmentate in sezioni sovrapposte per l’analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento dell’IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera di un essere umano o generato dall’IA.)

Il modello estrae le frasi, le segmenta in sezioni sovrapposte e classifica ogni sezione. Ogni sezione riceve un punteggio di probabilità compreso tra 0 e 1. In questo processo passano solo le frasi di prosa idonee. I contenuti non in prosa non vengono mai segmentati né valutati, perché il modello non li tratta come testo analizzabile.

Ecco perché il perimetro del «testo idoneo» determina direttamente ciò che la percentuale rappresenta. Il punteggio è un aggregato dei punteggi di probabilità a livello di sezione, e di questo aggregato fanno parte solo le frasi di prosa idonee.

Le tabelle entrano, le bibliografie no

Due tipi di contenuto specifici hanno regole proprie.

Tabelle: "We are now able to process long-form prose text in tables." (Ora siamo in grado di elaborare testi in prosa di una certa lunghezza all’interno delle tabelle.) La prosa contenuta nelle celle di una tabella, se scritta in frasi grammaticalmente standard, rientra ora nel testo idoneo. Invia di nuovo gli elaborati già consegnati che contengono tabelle, così vengono rielaborati. Se hai un documento con una prosa consistente nelle tabelle ed è stato inviato prima di questo aggiornamento, il punteggio IA potrebbe non riflettere il contenuto delle tabelle finché non lo invii di nuovo.

Bibliografie: "We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report." (Abbiamo corretto un bug che occasionalmente evidenziava scrittura IA all’interno dei riferimenti elencati in una bibliografia. Le bibliografie sono ora escluse dall’elaborazione del report di scrittura IA.) Invia di nuovo gli elaborati già consegnati che contengono sezioni di riferimenti evidenziate, così vengono rielaborati. Se il tuo report precedente mostrava testo segnalato nella bibliografia, si trattava di un bug: inviandolo di nuovo, quelle sezioni resteranno fuori dall’analisi. Perché Turnitin segnala i miei riferimenti e le mie citazioni spiega fin dove arrivano le esclusioni sul versante della similarità.

Queste due regole dicono che la definizione di testo idoneo non è fissa. È stata affinata per includere la prosa nelle tabelle ed escludere le bibliografie, ed è uno dei motivi per cui il tuo punteggio IA su Turnitin può cambiare inviando di nuovo l’elaborato senza che il testo cambi.

I falsi positivi nella prosa idonea

Anche all’interno della prosa idonea, alcuni modi di scrivere sono più esposti ai falsi positivi. La documentazione individua schemi precisi.

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (A volte i falsi positivi (segnalare erroneamente come generato dall’IA un testo scritto da un essere umano) possono riguardare contenuti con poca varietà strutturale, testi che si ripetono letteralmente o testi riformulati senza sviluppare nuove idee.)

"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Se il nostro indicatore mostra una quantità maggiore di scrittura IA in questo tipo di testo, ti consigliamo di tenerne conto quando guardi la percentuale indicata.)

Quindi, se la tua prosa è strutturalmente monotona, ripete le stesse espressioni o è una riformulazione senza nuove idee, il modello può segnalarla come generata dall’IA anche se l’hai scritta tu. Non è un fallimento del filtro del testo idoneo: è ciò che misurano i rilevatori di IA che fa esattamente ciò per cui è stato addestrato. È un problema diverso, che sta dentro la prosa che invece entra nell’analisi.

Che cosa significa per te

Se vuoi capire perché il tuo report IA di Turnitin è fatto così, ecco il riassunto:

  • Contano solo le frasi in prosa. Le liste, gli elenchi puntati e le strutture che non formano frasi sono esclusi dall’analisi. Il modello si concentra sulle frasi grammaticalmente standard.
  • La percentuale riguarda solo la prosa idonea. Non è la percentuale dell’intero elaborato. Da qui nasce la discrepanza tra il numero e le evidenziazioni.
  • Ora anche la prosa nelle tabelle viene elaborata. La prosa lunga nelle tabelle conta come testo idoneo. Invia di nuovo gli elaborati già consegnati che contengono tabelle, così vengono rielaborati.
  • Le bibliografie sono escluse. È stato corretto il bug che segnalava i riferimenti. Invia di nuovo gli elaborati già consegnati che contengono sezioni di riferimenti evidenziate, così vengono rielaborati.
  • Attenzione ai falsi positivi. Una prosa piatta, ripetitiva o riformulata ha più probabilità di essere segnalata. Tienine conto quando leggi la percentuale.

I passaggi che soddisfano i requisiti possono essere rielaborati gratuitamente.

CONTINUA A LEGGERE