Pourquoi Turnitin dit que votre travail est écrit à 100 % par l'IA
Le 100 % n'est pas une version plus assurée du 60 %. Dans le récit que fait Turnitin de la façon dont le chiffre est assemblé, les extrêmes sont précisément l'endroit où le calcul avait le moins d'éléments entre lesquels faire une moyenne.
L'équipe HumanPen
· 11 min de lecture
Commencez ici, avant l'explication
Trois situations produisent un 100 bien plus souvent que l'idée que chaque phrase que vous avez écrite donne l'impression d'avoir été rédigée par une machine, et vous pouvez les confirmer ou les écarter en une dizaine de minutes. Vérifiez d'abord quel chiffre vous tenez : Turnitin indique que l'indicateur d'écriture par IA n'est pas visible pour les étudiants ; un pourcentage que vous auriez trouvé vous-même, dans votre propre vue, est donc le score de similarité et non celui de l'IA. Vérifiez la quantité de prose que contient le fichier : Turnitin précise que dans les documents de quelques centaines de mots seulement, la prédiction est « mostly 'all or nothing' » (le plus souvent « tout ou rien »), parce qu'elle porte sur un seul segment, sans possibilité de chevauchement. Vérifiez de quoi le 100 est le pourcentage : le chiffre est calculé sur le texte éligible, et Turnitin dit que ce chiffre « is not necessarily the percentage of the entire submission » (n'est pas nécessairement le pourcentage de l'ensemble du dépôt). Ce n'est que lorsque ces trois pistes sont écartées qu'il devient pertinent de se demander ce que le modèle a vu dans l'écriture elle-même.
Les trois appellent des réponses complètement différentes, et c'est pourquoi l'ordre compte plus que l'explication. Cette page porte sur la façon dont un chiffre extrême est produit. Ce n'est pas un scénario pour un entretien portant sur une inconduite, et rien ici ne prédit ce que dira un futur rapport.
D'abord, vérifiez quel 100 vous avez entre les mains
Turnitin est explicite sur la question de savoir qui peut voir le chiffre d'IA. Sa documentation indique que « only instructors and administrators are able to see the indicator » (seuls les enseignants et les administrateurs peuvent voir l'indicateur), et séparément que « The AI writing detection indicator and report are not visible to students. » (L'indicateur et le rapport de détection d'écriture par IA ne sont pas visibles pour les étudiants.) La phrase qui suit immédiatement la seconde compte tout autant : « However, with the PDF download feature, instructors can download and share the AI report with students. » (Cependant, grâce à la fonction de téléchargement PDF, les enseignants peuvent télécharger et partager le rapport d'IA avec les étudiants.) Les deux voies existent donc. Un PDF que quelqu'un vous a envoyé peut tout à fait être le rapport d'IA. Un pourcentage sur lequel vous avez cliqué vous-même, dans votre propre vue du dépôt, n'est pas l'indicateur d'IA.
Reste l'autre chiffre, et là, 100 est une valeur bien plus ordinaire. Un score de similarité de 100 % a une origine documentée et parfaitement innocente : vos propres brouillons antérieurs, enregistrés dans le cadre d'un autre devoir, correspondent à votre version finale presque mot pour mot. Nous avons retracé la façon dont cela se produit, et les cas où cela ne se produit pas, dans mon brouillon antérieur correspondra-t-il à mon nouveau dépôt. Les deux rapports sont des analyses distinctes qui peuvent diverger dans les quatre directions, ce qui est l'objet de rapport d'IA contre rapport de similarité.
Un 100 du côté de la similarité et un 100 du côté de l'IA sont des constats différents, avec des causes différentes et des réponses différentes. Passer une soirée entière sur le mauvais chiffre est la façon la plus courante de faire tourner cette situation mal.
Les documents courts sont notés en tout ou rien
La description publiée par Turnitin du calcul comporte trois mouvements : les phrases sont extraites puis regroupées en segments chevauchants, chaque segment reçoit une probabilité comprise entre 0 et 1, et chaque phrase éligible hérite du score de chaque segment dans lequel elle se trouve. Comme les segments se chevauchent, une phrase située près d'une frontière porte plus d'un score, et ces scores sont ensuite regroupés. Ce sont ces scores de phrase regroupés qui sont agrégés pour former le chiffre du document. C'est précisément ce calcul de moyenne qui explique qu'un document puisse revenir à 43 plutôt qu'à l'une des extrémités.
Retirez maintenant cela. La FAQ de Turnitin dit ce qui se passe lorsqu'il n'y a rien sur quoi faire une moyenne :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », parce que nous prédisons sur un seul segment, sans possibilité de chevauchement. Cela signifie qu'un texte mêlant du contenu généré par l'IA et du contenu original pourrait être signalé comme entièrement généré par l'IA.)
Lisez cela comme une affirmation portant sur la résolution, et non sur la justesse. Dans un document long, un 100 signifierait qu'un grand nombre de prédictions distinctes sont toutes tombées du même côté. Dans un document de quelques centaines de mots, il peut signifier une seule prédiction, que l'interface affiche ensuite sous forme de pourcentage. Les deux s'affichent de façon identique et ne constituent pas le même type de preuve ; et la seconde phrase de cette citation dit sans détour que ce sont les contenus mixtes qui se trouvent emportés.
Il y a un plancher sous tout cela. Un dépôt doit contenir au moins 300 mots de prose dans un format long avant même qu'un rapport d'IA ne soit généré. Le fichier le plus court qui puisse recevoir un chiffre est donc aussi celui dont le chiffre repose sur le moins d'observations indépendantes, et la tranche située juste au-dessus du plancher est l'endroit où ces deux faits se recouvrent. Un travail de réflexion de 900 mots, un court compte rendu d'exercices, un résumé de conférence gonflé pour atteindre la longueur requise : tous se situent dans la zone que décrit Turnitin. Ce qui se passe à l'autre bout de la plage, lorsqu'une thèse dépasse ce que couvre un seul rapport, nous l'avons examiné dans Turnitin peut-il vérifier une thèse entière.
100 % de quoi, au juste ?
Le pourcentage n'est pas calculé sur votre document. Il est calculé sur ce que Turnitin appelle le texte éligible, et la définition est étroite : « This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte éligible n'inclut que des phrases de prose, ce qui signifie que nous n'analysons que des blocs de texte rédigés en phrases grammaticalement standard et que nous n'incluons pas d'autres types d'écriture tels que les listes, les puces (structures courtes qui ne sont pas des phrases) ou d'autres structures qui ne sont pas des phrases.) La phrase qui suit est celle à retenir : « This percentage is not necessarily the percentage of the entire submission. » (Ce pourcentage n'est pas nécessairement le pourcentage de l'ensemble du dépôt.)
Certaines exclusions sont énoncées séparément. Les notes de version de Turnitin consignent la correction d'un bug qui surlignait de l'écriture par IA dans les bibliographies, et précisent que « Bibliographies are now excluded when processing the AI writing report » (Les bibliographies sont désormais exclues lors du traitement du rapport d'écriture par IA), et ailleurs que « We are now able to process long-form prose text in tables. » (Nous sommes désormais en mesure de traiter de la prose longue dans les tableaux). Les deux entrées se terminent de la même manière, par une consigne : ne présumez pas que le changement s'applique à ce que vous avez déjà déposé, redéposez pour relancer le traitement. Ainsi, une liste de références est hors du calcul, et des paragraphes situés dans un tableau y sont inclus, ce qui ne correspond à l'intuition de presque personne sur l'un ou l'autre point.
Faites passer un vrai fichier dans ce filtre. Un rapport de laboratoire de 5 000 mots avec un tableau de méthodes, trois listes de protocole à puces, une annexe et 60 références pourrait ne contenir que 2 000 mots éligibles. Un 100 sur ce rapport est une affirmation portant sur ces 2 000 mots. Ce n'est pas une affirmation sur les 3 000 autres, qui n'ont jamais été évalués et qui ne peuvent être ni défendus ni attaqués à partir du chiffre.
C'est aussi la raison pour laquelle un 100 peut coexister avec des pages qui ne portent aucun surlignage. Turnitin indique qu'un document contenant plusieurs types d'écriture différents « would result in a disparity between the percentage and the highlights » (entraînerait un écart entre le pourcentage et les surlignages). Au sommet de la plage, cet écart ressemble à une contradiction, et c'est un comportement attendu.
Compter les lignes surlignées et les comparer au pourcentage ne résoudra rien, car les deux sont calculés sur des choses différentes. Comment lire un rapport d'écriture par IA de Turnitin passe en revue les autres états du rapport pour la même raison.
Quand le document est long et revient pourtant au sommet
Si le fichier fait 8 000 mots de prose continue, l'explication par le segment unique disparaît. Beaucoup de prédictions distinctes sont réellement tombées du même côté, et la question devient celle-ci : qu'est-ce qui pourrait faire qu'un document entier paraisse identique au modèle d'un bout à l'autre ? Turnitin publie une réponse partielle, sous la forme des propriétés qu'il dit retrouver dans ses propres faux positifs :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Il arrive que les faux positifs — signaler à tort un texte écrit par un humain comme généré par l'IA — portent sur un contenu sans grande variation structurelle, un texte qui se répète littéralement, ou un texte paraphrasé sans développer d'idées nouvelles. Si notre indicateur montre une quantité plus élevée d'écriture par IA dans un tel texte, nous vous conseillons d'en tenir compte lorsque vous examinez le pourcentage indiqué.)
Ces trois propriétés sont toutes des propriétés d'un document entier, et non d'une phrase. C'est notre lecture, pas une affirmation de Turnitin, mais c'est la partie qui correspond à la forme de la question : un travail rédigé selon un ordre de sections imposé, dans une discipline qui a une manière figée de formuler un paragraphe de méthodes, et qui répète ses propres objectifs dans le résumé, puis dans l'introduction, puis dans la discussion, a à peu près le même caractère dans chaque segment. Aucun passage ne diffère assez de ses voisins pour tirer l'agrégat vers le bas. L'uniformité n'est pas un défaut d'écriture, et dans plusieurs genres elle est précisément l'exigence, ce qui explique que le résultat soit difficile à contester en pointant un paragraphe particulier.
La seconde phrase de cette citation est une consigne du fournisseur à celui qui lit le score, pas un argument que vous construisez. Ce qui a réellement fait bouger les décisions est un autre sujet, que nous avons traité à partir de cas documentés dans signalé, alors que vous l'avez écrit vous-même. Si une révision est appropriée et autorisée, les propriétés de cette liste sont aussi ce qui se rapproche le plus d'un cahier des charges pour le faire à la main, ce qui est l'approche de comment humaniser un texte d'IA sans outil.
Ce qu'un 100 ne tranche pas
Une chose à savoir avant de bâtir le moindre argument sur l'idée que le chiffre serait exagéré : le réglage publié va dans l'autre sens. Turnitin indique que « In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document » (Afin de maintenir ce faible taux de 1 % de faux positifs, il est possible que nous passions à côté d'une partie du texte écrit par IA dans un document), et donne le sens de l'erreur : « if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing. » (si nous identifions que 50 % d'un document ont probablement été écrits par un outil d'IA, ce document pourrait contenir jusqu'à 65 % d'écriture par IA). Quoi qu'il se passe par ailleurs, l'idée que l'outil serait conçu pour signaler trop n'est pas la conception que décrit le fournisseur.
Cela ne fait pas pour autant d'un 100 un constat. Turnitin énonce dans trois pages d'aide distinctes que son modèle peut mal identifier un texte écrit par un humain, généré par l'IA ou paraphrasé par l'IA, et qu'il ne doit pas être le seul fondement d'une mesure défavorable à un étudiant. Et l'affirmation de précision que les gens se renvoient comporte une réserve qui se perd en route, réserve que nous avons démontée dans ce que signifie un taux de faux positifs de 1 %. Il n'existe pas non plus de seuil publié à partir duquel un chiffre devient une inconduite, dans un sens comme dans l'autre : est-ce que 20 % d'IA, c'est trop ? explique pourquoi le 20 de l'interface est une règle d'affichage et non une règle qui vous concerne.
Si vous l'avez écrit, le réécrire est le mauvais premier geste. Cela change l'objet en discussion et répond à une question que personne n'a posée.
Là où un outil de réécriture a sa place, et là où un 100 le rend inutile
Il faut le dire clairement, même si cela va contre nous : à 100, ce pour quoi l'outil HumanPen est normalement utile n'a rien à quoi se raccrocher. Vous téléversez le document avec le rapport Turnitin ou iThenticate et seuls les passages repérés par le rapport sont réécrits, le reste étant conservé mot pour mot, et la facturation ne compte que les mots effectivement réécrits. C'est une économie réelle à 30 %, où les deux tiers du fichier ne sont jamais touchés ni facturés. À 100 %, le rapport a tout marqué : le périmètre est donc le document entier et le coût, une passe complète. Si vous espériez que le rapport réduirait la tâche, le 100 est le seul chiffre pour lequel il ne le fait pas.
Si un nouveau rapport signale encore des passages, les passages éligibles peuvent être relancés gratuitement.
Rien de tout cela n'est une promesse quant à un résultat de détection, et nous n'en ferons aucune. Aucun outil ne peut vous dire ce qu'une version future du modèle produira sur un document qu'il n'a pas vu, et quiconque promet un score garanti décrit quelque chose qu'il ne maîtrise pas. Il y a aussi des cas où l'outil est simplement le mauvais instrument : si votre position est que le travail est le vôtre, le chiffre n'est pas l'objet à réparer.
Questions fréquentes
Est-ce que 100 % signifie que toutes les phrases que j'ai écrites ont été signalées ? Non. Le pourcentage est calculé sur le texte éligible, qui exclut les listes, les puces et les autres structures qui ne sont pas des phrases, et Turnitin précise que ce chiffre n'est pas nécessairement le pourcentage de l'ensemble du dépôt. Un fichier comportant de nombreux tableaux, des listes et une section de références peut afficher 100 % alors qu'une grande partie de son contenu n'a jamais été évaluée.
Mon essai ne fait que 600 mots. Est-ce l'explication ? C'est la première chose à vérifier. Turnitin l'expose ainsi : dans les documents de quelques centaines de mots, la prédiction est le plus souvent « all or nothing » (tout ou rien), parce qu'elle travaille sur un seul segment, sans possibilité de chevauchement, et qu'un mélange de contenu généré par l'IA et de contenu original peut donc être signalé comme entièrement généré par l'IA.
J'ai vu le chiffre dans ma propre vue Turnitin. Est-ce le score d'IA ? Presque certainement pas. Turnitin indique que seuls les enseignants et les administrateurs peuvent voir l'indicateur d'IA et qu'il n'est pas visible pour les étudiants, même si les enseignants peuvent télécharger le rapport d'IA en PDF et le partager. Un pourcentage auquel vous êtes arrivé vous-même est le score de similarité, qui a ses propres chemins ordinaires vers 100.
Un outil peut-il garantir que le prochain rapport sera plus bas ? Non, et considérez cette promesse comme un signal d'alarme. Les versions des détecteurs changent, et personne en dehors du fournisseur ne peut s'engager sur le résultat d'une version du modèle qui n'a pas encore tourné. Ce qu'un service de révision peut définir, c'est le périmètre et le coût, pas un score.
CONTINUER LA LECTURE
Un outil de réécriture par IA relève-t-il des règles de votre université sur l’édition par un tiers ?
14 min de lecture
Détecteurs IAFaut-il changer votre façon d’écrire pour ne pas être signalé ?
11 min de lecture
Détecteurs IAJ'ai reformulé un texte d'IA avec une autre IA et Turnitin l'a quand même signalé
14 min de lecture