J’ai révisé mon mémoire et le score d’IA a augmenté

Le chiffre n’est pas obtenu en additionnant des verdicts phrase par phrase ; rien dans sa fabrication ne l’oblige donc à suivre les phrases que vous avez corrigées. Trois éléments publiés du calcul peuvent le pousser dans l’autre sens pendant que vos modifications font exactement ce que vous vouliez qu’elles fassent.

L'équipe HumanPen

· 10 min de lecture

La réponse courte

Un deuxième rapport qui affiche un chiffre plus élevé que le premier ne mesure pas la qualité de votre révision. Trois éléments publiés de la façon dont Turnitin produit le pourcentage peuvent, chacun de leur côté, le faire monter. Les phrases sont évaluées à l’intérieur de segments qui se chevauchent : une modification change donc ce avec quoi ses voisines sont regroupées, et l’effet n’a pas de rayon fixe. Le pourcentage est calculé uniquement sur la prose éligible ; une révision qui retire de la prose du document réduit donc le dénominateur, alors que le texte signalé ne bouge pas. Et les surlignages que vous pouvez compter et le chiffre figurant en page de garde sont deux grandeurs différentes, autorisées à évoluer en sens contraire dans un même rapport.

Rien de tout cela ne dit que la révision était mauvaise ou que le texte a empiré. Cela dit que la grandeur rapportée ne se comporte pas comme le mot « pourcentage » vous invite à le supposer. Vous trouverez ci-dessous chaque mécanisme à côté du document dont il provient, plus un quatrième qui ne mord que si la révision a aussi nettement raccourci le document ; puis ce qu’une hausse établit et ce qu’elle n’établit pas.

Rien de ce que vous modifiez ne reste local

Commençons par la façon dont une phrase reçoit un score, car la réponse est qu’elle n’en reçoit pas un à elle. La FAQ de Turnitin décrit le traitement en un seul paragraphe :

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et découpées en sections qui se chevauchent pour l’analyse de prédiction. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase éligible au sein de ces sections hérite du score de la section. Comme les sections se chevauchent, certaines phrases peuvent avoir plusieurs scores, qui sont ensuite regroupés en un seul. Ces scores de phrase sont ensuite agrégés et servent à calculer le score global d’écriture IA du document.)

Deux mots, dans ce texte, portent tout le problème : « overlapping » (chevauchants) et « pooled » (regroupés). Une phrase se trouve dans plus d’un segment, et chaque segment est classé comme un bloc. Chaque score porté par une phrase a donc été produit en partie par les phrases qui l’encadrent.

Réécrivez une phrase et vous avez modifié une donnée d’entrée des scores de ses voisines, que vous les ayez touchées ou non. Un paragraphe que vous avez délibérément laissé tranquille peut revenir surligné, parce que le segment qui le contient contient maintenant un autre texte. L’inverse se produit aussi, et c’est la version sur laquelle personne n’écrit pour poser la question.

Les frontières des segments elles-mêmes sont un élément mobile dans le récit du fournisseur. Dans une note de version datée du 24 mai 2023, qui décrit un travail mené pour réduire les faux positifs au début et à la fin des documents, Turnitin a ajouté :

"We also worked on making our segment boundaries detection more precise which could lead in some rare cases to change of boundaries compared with a previous version." (Nous avons aussi travaillé à rendre plus précise la détection des frontières de nos sections, ce qui peut, dans de rares cas, entraîner un changement de frontières par rapport à une version précédente.)

C’était une amélioration apportée en 2023 et non la description d’un défaut actuel, et cela mérite d’être lu pour une raison précise : les frontières de segments font partie du processus, et Turnitin a documenté le fait qu’il les modifiait. La FAQ rend aussi explicite l’existence du regroupement et de l’agrégation. Ce qu’elle ne publie pas, c’est la règle de regroupement, une éventuelle pondération ou l’algorithme d’agrégation. Il n’existe donc aucun moyen de savoir à l’avance quelles voisines une modification donnée va déplacer, ni dans quelle direction.

Le dénominateur peut bouger pendant que vous regardez ailleurs

Le deuxième mécanisme n’a rien à voir avec la classification. C’est de l’arithmétique, et c’est celui qui produit les plus grosses surprises.

"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. This percentage is not necessarily the percentage of the entire submission." (Ce texte éligible n’inclut que des phrases de prose, ce qui signifie que nous n’analysons que des blocs de texte rédigés en phrases grammaticales standard et que nous n’incluons pas d’autres types d’écriture comme les listes, les puces (structures courtes non phrastiques) ou d’autres structures non phrastiques. Ce pourcentage n’est pas nécessairement celui de l’ensemble de la soumission.)

Mettons des chiffres dessus. Supposons que la première version contenait 6 000 mots de prose éligible, dont 1 800 sont revenus signalés : 30 %. Pour la deuxième version, vous réécrivez 300 mots signalés et ils cessent de l’être ; il en reste 1 500. Dans la même séance, parce qu’un directeur a trouvé la discussion laborieuse, vous transformez encore 2 400 mots en un résumé à puces et en un tableau de chiffres. La prose éligible est maintenant de 3 600 mots. 1 500 sur 3 600, c’est un peu moins de 42 %. Le score a grimpé de douze points dans une révision où moins de texte était signalé qu’avant et où rien de nouveau n’a été signalé nulle part.

Une modification que vous avez peut-être faiteCe qu’elle fait à la prose éligible
Vous avez transformé trois paragraphes en liste à pucesCes mots sortent de l’analyse. Turnitin désigne les puces et les autres structures courtes non phrastiques comme des éléments qu’il n’analyse pas
Vous avez déplacé une description dans un tableauCela dépend de ce que vous y avez mis. Une note de version d’août 2023 indique que la prose longue dans les tableaux est désormais traitée ; un tableau de chiffres n’est de toute façon pas de la prose
Vous avez ajouté vingt références de plusRien du tout. La même note de version indique que les bibliographies sont exclues lors du traitement du rapport d’écriture IA
Vous avez coupé 1 500 mots de prose non signalée pour respecter une limiteLe dénominateur baisse et la part signalée monte, sans aucun changement du tout au texte signalé

Ces deux lignes d’août 2023 se terminent de la même manière, en vous demandant de resoumettre un ancien travail avant que l’un ou l’autre changement ne s’y applique : ce qu’elles décrivent, c’est donc la façon dont un rapport est produit aujourd’hui, et non la façon dont un ancien l’a été. Et rien dans ce tableau n’est un conseil. Deux de ces lignes décrivent une manière de rendre un document plus difficile à lire, et un correcteur qui reçoit une section de discussion sous forme de puces le remarque. La raison de connaître cette liste est diagnostique : si l’une de ces lignes décrit votre révision, le mouvement a une explication qui ne dit rien de la façon dont vos phrases se lisent. Le cas de la liste de références a son propre nœud, que nous avons démêlé dans pourquoi Turnitin a signalé mes références.

Moins de surlignages et un chiffre plus bas ne sont pas le même événement

La plupart regardent d’abord les surlignages, parce qu’une liste plus courte est la partie qui donne l’impression d’avancer. Turnitin dit clairement que les deux peuvent diverger :

"This means that a document containing several different writing types would result in a disparity between the percentage and the highlights." (Cela signifie qu’un document contenant plusieurs types d’écriture différents produirait un écart entre le pourcentage et les surlignages.)

Que vous ayez moins de passages surlignés que la dernière fois et que le chiffre ait quand même augmenté n’est donc pas une contradiction qu’il faudrait résoudre. Ce sont deux grandeurs à dénominateurs différents, lues comme si elles n’en faisaient qu’une. Et sous le seuil de 20 %, il n’y a rien à compter : Turnitin retient à la fois le score et les surlignages pour les résultats situés entre 1 % et 19 %, de sorte qu’un rapport sans surlignage n’est pas un rapport où rien n’est signalé. Nous avons passé en revue les parties du rapport l’une après l’autre dans comment lire un rapport d’écriture IA Turnitin.

Un envoi plus court est un envoi moins stable

Si la révision a aussi été une coupe, il existe un quatrième mécanisme, qui vaut surtout pour les envois courts :

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Dans les documents courts qui ne comptent que quelques centaines de mots, la prédiction sera surtout « tout ou rien », parce que nous prédisons sur une seule section, sans possibilité de chevauchement. Cela signifie qu’un texte mêlant contenu généré par IA et contenu original pourrait être signalé comme entièrement généré par IA.)

Le chevauchement qui lisse un long document n’est pas disponible sur un court, et le mode de défaillance décrit par Turnitin va vers le haut : du contenu mixte signalé comme entièrement IA. Il y a aussi un plancher en dessous, puisque les exigences de fichier demandent au moins 300 mots de prose avant même qu’un rapport soit généré — un point que nous avons traité dans Turnitin peut-il vérifier une thèse entière. Entre les deux, une révision qui a raccourci le texte et une révision qui en a modifié la prose sont deux expériences menées en même temps, et le rapport rend un seul chiffre pour les deux.

Ce qu’une hausse établit et ce qu’elle n’établit pas

Rien dans le rapport n’enregistre ce que vous avez changé. Aucun champ n’attribue le mouvement à une modification précise. La hausse est donc une observation portant sur deux fichiers, et non un jugement sur le travail accompli entre les deux.

  • Elle n’établit pas que vos modifications ont donné au texte une allure plus artificielle. Avec les mécanismes décrits plus haut, le chiffre peut monter alors que toutes les phrases que vous avez réécrites reviennent propres.
  • Elle n’établit pas que le premier chiffre était celui auquel il fallait faire confiance. Les deux rapports sont deux sorties distinctes, et aucun n’explique pourquoi il diffère de l’autre.
  • Elle n’établit pas qu’une nouvelle passe de réécriture soit la prochaine étape. Si le dénominateur a bougé, une passe supplémentaire sur la prose ne change que le numérateur.

Il y a aussi, dans la FAQ de Turnitin, une phrase qui a sa place dans cette conversation, et qu’on cite presque toujours sans sa seconde moitié :

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated." (Il arrive que des faux positifs (le fait de signaler à tort comme généré par IA un texte écrit par un humain) concernent un contenu sans grande variation structurelle, un texte qui se répète littéralement, ou un texte paraphrasé sans développement d’idées nouvelles. Si notre indicateur montre une quantité plus élevée d’écriture IA dans un tel texte, nous vous conseillons d’en tenir compte lorsque vous regardez le pourcentage indiqué.)

Lue jusqu’au bout, ce n’est pas une accusation pointée vers vous. C’est le fournisseur qui nomme des types d’écriture humaine que son propre modèle peut signaler à tort, puis qui demande à celui qui lit le rapport de prendre cette possibilité en considération en regardant le pourcentage. Si un directeur regarde un chiffre qui a augmenté, cette mise en garde figure sur la même page que le chiffre. La liste d’édition manuelle bâtie sur la première moitié se trouve dans comment humaniser un texte IA sans outil, et la méthode pour comparer deux rapports passage par passage plutôt que total contre total, dans toujours signalé après une nouvelle vérification Turnitin.

Où une réécriture limitée au rapport trouve sa place

Tout ce qui précède est un argument sur le périmètre. Si modifier une phrase change ce avec quoi ses voisines sont regroupées, alors la plus petite chose qu’il soit raisonnable de modifier est plus grande qu’une phrase, et les passages qui vous conviennent méritent de rester exactement tels quels.

C’est le périmètre que décrit l’outil HumanPen sur sa page publique consacrée au rapport. Vous téléversez le DOCX avec un rapport d’IA Turnitin ou iThenticate, et les passages signalés définissent ce qui est réécrit. Tout le reste reste gelé. La page publique d’humanisation indique aussi que la facturation porte sur les mots réellement réécrits, et non sur la taille du fichier que vous avez envoyé.

Si un rapport ultérieur signale encore des passages, la FAQ publique décrit une deuxième passe gratuite sur les passages qui restent signalés. Cette règle de service n’est pas une prévision. Elle ne dit pas ce que lira le prochain rapport, et Turnitin n’a publié aucune correspondance entre une modification et un mouvement du score.

Questions fréquentes

Un score d’IA Turnitin peut-il vraiment augmenter après une révision ? Oui, et rien là n’est inhabituel. Le pourcentage n’est pas assemblé à partir de verdicts phrase par phrase ; il n’a donc aucune raison de suivre le nombre de phrases que vous avez corrigées. Les segments qui se chevauchent, une quantité différente de prose éligible et un document plus court le déplacent chacun de leur côté.

Un chiffre plus élevé signifie-t-il que mes modifications ont aggravé les choses ? Pas en soi. Le rapport ne contient aucune trace de ce que vous avez changé ni aucune attribution du mouvement à une modification donnée. Une hausse est compatible avec des modifications qui ont fonctionné, avec des modifications qui n’ont rien fait, et avec un document dont la structure a changé sous le calcul.

J’ai moins de phrases surlignées mais un pourcentage plus élevé. Lequel est le bon ? Les deux, car ce ne sont pas deux vues de la même grandeur. Turnitin indique qu’un document mêlant plusieurs types d’écriture présentera un écart entre le pourcentage et les surlignages, puisque le pourcentage est calculé sur la prose éligible alors que le surlignage porte sur le fichier entier.

J’ai supprimé beaucoup de texte pour tenir dans une limite de mots et le score a bondi. Pourquoi ? Le plus probable, c’est le dénominateur. Le pourcentage porte sur la prose éligible : retirer de la prose non signalée fait donc monter la part signalée, sans aucun changement du texte signalé. Si le résultat ne fait plus que quelques centaines de mots, Turnitin indique aussi que les documents courts sont prédits surtout de façon tout ou rien.

Dois-je simplement réécrire tout le mémoire ? C’est la réponse à laquelle invite le chiffre, et c’est rarement celle qu’appuient les éléments dont on dispose. Comparez l’emplacement des surlignages dans les deux rapports avant de décider quoi toucher, et gelez tout ce dont le libellé exact porte du sens : chiffres, citations, définitions et étapes de méthode.

CONTINUER LA LECTURE