Hai parafrasato: la similarità è scesa, ma il punteggio IA è salito. Ecco perché

La parafrasi è la prima mossa a cui si pensa per abbassare il punteggio di similarità di Turnitin. Molti studenti però scoprono che, dopo aver parafrasato, la similarità è scesa mentre il punteggio di rilevamento della scrittura IA è salito. Non è un malfunzionamento. I due punteggi misurano cose completamente diverse, e modificare un testo per sistemarne uno può spingere l'altro nella direzione sbagliata.

Team HumanPen

· 6 min di lettura

La risposta breve: due punteggi, due sistemi, nessun collegamento

Il punteggio di similarità e il punteggio di rilevamento della scrittura IA sono due misurazioni distinte che non si influenzano a vicenda. Turnitin lo dice esplicitamente: «The Similarity score and the AI writing detection percentage are completely independent and do not influence each other.» (Il punteggio di similarità e la percentuale di rilevamento della scrittura IA sono completamente indipendenti e non si influenzano a vicenda.)

Quando parafrasi per far scendere la percentuale di similarità, non c'è alcun meccanismo che trascini giù anche il punteggio IA. I due numeri possono muoversi in direzioni opposte, e spesso lo fanno. La parafrasi cambia le parole del tuo documento, riducendo le corrispondenze di stringhe nel database della similarità. Questi stessi cambiamenti possono alterare gli schemi di probabilità delle parole in modi che rendono più probabile che il rilevatore IA segnali il testo. Il risultato è lo scenario in cui si imbattono molti studenti: la similarità scende, il punteggio IA sale.

Cosa cerca davvero ciascun sistema

Per capire perché accade, dobbiamo guardare a cosa misura ciascun sistema. Il report di similarità confronta il testo che consegni con un database di contenuti esistenti. Come spiega Turnitin, «The Similarity score indicates the percentage of matching-text found in the submitted document when compared to Turnitin's comprehensive collection of content for similarity checking.» (Il punteggio di similarità indica la percentuale di testo corrispondente trovata nel documento inviato, confrontandolo con l'ampia raccolta di contenuti che Turnitin usa per il controllo della similarità.) La parafrasi riduce queste corrispondenze perché stai cambiando proprio le stringhe che il sistema cerca.

Il rilevatore di scrittura IA fa qualcosa di fondamentalmente diverso. Non cerca testo corrispondente: analizza gli schemi statistici delle parole che scegli. Ecco come Turnitin descrive il processo: «When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score.» (Quando un elaborato viene inviato a Turnitin, le frasi della consegna vengono estratte e segmentate in sezioni sovrapposte per l'analisi predittiva. Ogni sezione viene classificata dal modello di rilevamento IA e riceve un valore compreso tra 0 e 1, che indica la probabilità che il testo sia opera di un essere umano o generato dall'IA. Ogni frase idonea all'interno di queste sezioni eredita il punteggio della sezione. Poiché le sezioni si sovrappongono, alcune frasi possono avere più punteggi, che vengono poi riuniti in un punteggio unico. Questi punteggi di frase vengono ulteriormente aggregati e servono a calcolare il punteggio complessivo di scrittura IA del documento.)

Il sistema della similarità cerca stringhe che esistono già altrove. Il sistema IA cerca schemi di probabilità nel modo in cui le parole vengono scelte. La parafrasi cambia le stringhe, e questo aiuta la similarità, ma cambia anche gli schemi di probabilità, e questo può danneggiare il punteggio IA. Sono due bersagli diversi, e colpirne uno non significa colpire anche l'altro.

L'ironia: parafrasare senza idee nuove è un fattore noto di falsi positivi

È qui che la situazione diventa particolarmente frustrante. La documentazione stessa di Turnitin elenca la parafrasi tra le caratteristiche dei testi che possono produrre falsi positivi. Il testo completo: «Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.» (A volte i falsi positivi, cioè il segnalare come generato dall'IA un testo scritto da un essere umano, possono riguardare contenuti con poca varietà strutturale, testi che si ripetono letteralmente o testi che sono stati parafrasati senza sviluppare idee nuove.)

Turnitin fa seguire questo consiglio: «If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated.» (Se il nostro indicatore mostra una quantità maggiore di scrittura IA in questo tipo di testo, ti consigliamo di tenerne conto quando guardi la percentuale indicata.)

Qui sta il cuore del problema. Quando parafrasi per abbassare la similarità, la passata di solito resta dentro le idee già presenti sulla pagina. È esattamente il tipo di testo «paraphrased without developing new ideas» (parafrasato senza sviluppare idee nuove) che Turnitin segnala come soggetto a falsi positivi. Non stai aggiungendo nuove analisi, nuovi argomenti o nuove prove. Le idee restano le stesse, la struttura spesso resta simile, e ora il testo corrisponde a un profilo che il rilevatore IA associa a contenuti generati da una macchina. Le modifiche fatte per evitare le corrispondenze di similarità possono aver prodotto un testo che, statisticamente, assomiglia di più a un output IA, non di meno. Perché la parafrasi fa salire il tuo punteggio IA su Turnitin ripercorre lo stesso meccanismo dall'altro capo.

Probabilità delle parole: perché una riscrittura può spostare il punteggio nella direzione sbagliata

Una domanda frequente è se il rilevatore IA misuri cose come la «perplexity» o la «burstiness», termini che circolano nelle discussioni sulla detection IA; l'abbiamo affrontata a parte in Turnitin usa perplexity e burstiness. Turnitin risponde direttamente: «Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions.» (Il nostro modello non è programmato esplicitamente per valutare segnali specifici come burstiness, perplexity o altre singole metriche a volte citate nelle discussioni pubbliche.) Nella frase successiva aggiungono: «Instead, it learns statistical patterns from our training data.» (Al contrario, apprende schemi statistici dai nostri dati di addestramento.)

Questo non significa che la probabilità delle parole sia irrilevante. La stessa documentazione continua con un chiarimento decisivo: «Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers.» (I nostri classificatori sono addestrati a rilevare queste differenze nella probabilità delle parole e conoscono bene le particolari sequenze di probabilità tipiche di chi scrive come essere umano.)

Messe insieme, queste due affermazioni dicono qualcosa di importante. Il modello non calcola la perplexity come una metrica con un nome, ma è addestrato su schemi di probabilità delle parole. Quando una riscrittura ricade sull'opzione più ovvia in ogni posizione, potrebbe star scegliendo la parola statisticamente più prevedibile in quel punto. Se l'originale era una scelta insolita e ciò che la sostituisce è la scelta più comune, lo schema di probabilità delle parole diventa più prevedibile, non meno. Per un classificatore addestrato sulla probabilità delle parole, sequenze più prevedibili possono assomigliare di più a testo generato dall'IA. È questo il meccanismo dietro il paradosso: la parafrasi rende il testo meno simile alle fonti esistenti, ma le scelte di parole concrete possono renderlo più prevedibile statisticamente, che è l'opposto di ciò che abbassa un punteggio IA.

Cosa significa questo in pratica

La conclusione pratica è che abbassare la similarità e abbassare un punteggio IA sono due obiettivi diversi. Richiedono modifiche diverse al testo, e le modifiche che aiutano uno possono danneggiare l'altro. La parafrasi da sola, soprattutto una passata che resta dentro le idee già presenti sulla pagina, è il tipo di approccio che abbassa la similarità e al tempo stesso può alzare il punteggio IA. Questa distanza è anche ciò su cui le due categorie di strumenti differiscono davvero.

Il report di similarità riguarda l'eventuale corrispondenza tra le tue stringhe e contenuti già esistenti. Il report IA riguarda la somiglianza tra i tuoi schemi di probabilità delle parole e il testo generato da una macchina. Provare a risolvere entrambi con la stessa passata di editing, in particolare una passata che resta dentro le idee già presenti sulla pagina, è esattamente il punto in cui nasce il conflitto. Se il tuo punteggio IA è salito dopo che hai parafrasato per la similarità, la causa è probabilmente che la parafrasi ha cambiato il tuo testo in modi che il rilevatore IA legge come più prevedibili, rientrando anche nel profilo da falso positivo di «paraphrased without developing new ideas.» (parafrasato senza sviluppare idee nuove).

Riepilogo operativo

Ecco cosa portare via da tutto questo:

  1. Il punteggio di similarità e il punteggio IA sono misurazioni indipendenti. Abbassarne uno non abbassa l'altro.
  2. Il sistema della similarità cerca stringhe corrispondenti. Il sistema IA analizza schemi di probabilità delle parole. Sono segnali diversi.
  3. «Paraphrased without developing new ideas» (parafrasato senza sviluppare idee nuove) è elencato esplicitamente da Turnitin come fattore di falsi positivi. Il criterio è se è comparsa un'analisi nuova, non quale modifica abbia prodotto la frase.
  4. Il modello IA non è programmato per burstiness o perplexity come metriche denominate, ma è addestrato sulla probabilità delle parole. Una passata che ricade sull'opzione più prevedibile in ogni posizione può far sembrare il testo più generato da una macchina.
  5. Abbassare la similarità e abbassare il punteggio IA sono obiettivi separati. La parafrasi da sola può aiutare uno e danneggiare l'altro.

Quando i passaggi idonei possono essere rielaborati gratuitamente, hai spazio per iterare, che è esattamente a cosa serve importare il report di Turnitin. La chiave è trattare i due punteggi come problemi separati che richiedono approcci separati.

CONTINUA A LEGGERE