Un score Turnitin de 100 % d’IA peut-il encore être celui d’un texte écrit par un humain ?
Voir s’afficher "100% AI" sur son propre travail a de quoi inquiéter. Mais la FAQ de Turnitin indique que le modèle « may not always be accurate » (peut ne pas toujours être exact), que le score ne doit pas servir « as the sole basis for action » (d’unique fondement à une décision), et que certaines caractéristiques du texte favorisent les faux positifs. Comprendre ces déclarations est la première étape pour réagir à ce score.
L'équipe HumanPen
· 5 min de lecture
La réponse courte
Oui, un document entièrement écrit par un humain peut tout à fait recevoir un score IA de 100 %. La documentation de Turnitin elle-même indique que le modèle « may not always be accurate » (peut ne pas toujours être exact) et que l’indicateur d’écriture IA « should not be used as the sole basis for action. » (ne doit pas servir de seule base à une décision). La FAQ dresse aussi la liste des caractéristiques de texte qui favorisent les faux positifs : un contenu qui varie peu sur le plan structurel, un texte qui se répète, ou un texte paraphrasé sans développer d’idées nouvelles. Un score de 100 % ne signifie pas que le détecteur est certain que vous avez utilisé une IA : cela signifie que la classification de vos segments de texte par le modèle a produit des valeurs de probabilité qui, une fois agrégées, atteignent 100 %. Que ce résultat soit juste dépend d’éléments que le score, lui, ne dit pas.
Ce que Turnitin dit de sa propre fiabilité
La FAQ de Turnitin indique :
« Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors. » (C’est pourquoi nous devons insister sur le fait que le pourcentage affiché par l’indicateur d’écriture IA ne doit pas servir d’unique fondement à une décision ni de critère de notation définitif pour les enseignants.)
Un autre article d’aide le dit plus directement :
« Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student. » (Notre modèle de détection de l’écriture IA peut ne pas toujours être exact : il peut se tromper sur un texte écrit par un humain, généré par une IA ou paraphrasé par une IA. Il ne doit donc pas servir de seule base à des mesures défavorables à un étudiant.)
La phrase suivante de cet article : « It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred. » (Il faut un examen plus approfondi et l’appréciation d’un être humain, conjugués à l’application par l’établissement de ses propres politiques académiques, pour déterminer s’il y a eu inconduite académique.)
Turnitin publie aussi une page d’orientation à l’intention des enseignants, qui présente le score comme un élément parmi d’autres :
« It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy. » (Il n’est pas conçu pour fournir à lui seul des réponses définitives. Plus important que n’importe quel outil : l’enseignant qui voit le score et prend ses décisions en mettant cette information en balance avec la connaissance personnelle qu’il a de ses étudiants, de leur travail et de la politique de l’établissement.)
Lues ensemble, ces déclarations disent trois choses. Le modèle peut se tromper. Le score est une donnée parmi d’autres, pas un verdict définitif. Et déterminer s’il y a eu inconduite demande un jugement humain qui va au-delà du score.
Quand les faux positifs sont plus probables
La FAQ de Turnitin énumère les caractéristiques de texte précises qui peuvent produire des faux positifs :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. » (Il arrive que les faux positifs — signaler à tort comme généré par IA un texte écrit par un humain — concernent un contenu qui présente peu de variation structurelle, un texte qui se répète littéralement, ou un texte paraphrasé sans développer d’idées nouvelles.)
La phrase suivante : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur relève une proportion plus élevée d’écriture IA dans ce type de texte, nous vous conseillons d’en tenir compte au moment d’examiner le pourcentage indiqué.)
Cette phrase compte. Turnitin dit aux enseignants qu’un score élevé sur certains types de textes doit être abordé avec prudence. Si votre texte a une structure de phrase uniforme, s’il répète ses formulations, ou s’il paraphrase sans apporter d’analyse nouvelle, il partage les caractéristiques des textes que Turnitin elle-même dit propices aux faux positifs. Cela ne prouve pas que votre score est faux. Mais cela vous donne une explication concrète de la raison pour laquelle un texte écrit par un humain peut recevoir 100 %.
Documents courts : le problème du tout ou rien
La longueur du document compte aussi. La FAQ de Turnitin décrit un comportement bien précis pour les rendus courts :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car nous prédisons à partir d’un seul segment, sans possibilité de chevauchement.)
La phrase suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant contenu généré par IA et contenu original peut être signalé comme entièrement généré par IA.)
Une note de version de décembre 2023 ajoute : « Results show that our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate. » (Les résultats montrent que notre exactitude s’améliore avec un peu plus de texte : les copies de moins de 300 mots peuvent donc donner un score d’écriture IA probablement moins fiable.)
Si votre document est court, un score de 100 % a plus de chances d’être un artefact de classification « tout ou rien » qu’une mesure précise. Le détecteur dispose de moins de segments à analyser, de moins d’occasions de chevauchement et de moins de données à moyenner. Quelques centaines de mots écrits par un humain qui partagent par hasard les régularités statistiques d’une prose générée par IA peuvent être signalés comme entièrement issus de l’IA. Le fonctionnement segment par segment qui se cache derrière cela est détaillé dans pourquoi Turnitin dit que votre travail est écrit à 100 % par une IA.
Le choix fait par Turnitin
La FAQ de Turnitin reconnaît un arbitrage assumé dans sa gestion des faux positifs :
« In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing. » (Pour maintenir ce faible taux de faux positifs de 1 %, il se peut que nous manquions une partie du texte écrit par IA dans un document. Cela ne nous pose pas de problème, car nous ne voulons pas signaler à tort un texte écrit par un humain comme écrit par une IA. Par exemple, si nous estimons que 50 % d’un document ont probablement été écrits par un outil d’IA, ce document pourrait contenir jusqu’à 65 % d’écriture IA.)
La direction est claire : Turnitin préfère laisser passer du texte IA plutôt que d’accuser à tort un auteur humain. Mais l’erreur inverse, signaler à tort un texte humain comme écrit par IA, se produit encore à un taux que l’entreprise décrit comme inférieur à 1 % pour les documents contenant plus de 20 % d’écriture IA. Ce taux n’est pas nul. Dans une classe de 200 étudiants qui rendent des copies entièrement écrites par eux, un ou deux pourraient être signalés selon l’objectif que s’est fixé l’entreprise elle-même. Ce que signifie un taux de faux positifs de 1 % quand une université soumet 75 000 copies pousse ce calcul à plus grande échelle.
Que faire si cela vous est arrivé
Pour résumer ce que nous avons vu :
- La documentation de Turnitin elle-même indique que le modèle « may not always be accurate » (peut ne pas toujours être exact) et que le score ne doit pas servir « as the sole basis for action. » (de seule base à une décision).
- Certains types de textes sont propices aux faux positifs : peu de variation structurelle, répétitions et paraphrase sans idées nouvelles.
- Les documents courts (quelques centaines de mots) sont soumis à des prédictions « tout ou rien » et peuvent être moins fiables.
- L’objectif officiel en matière de faux positifs est inférieur à 1 % pour les documents contenant plus de 20 % d’IA, ce qui n’est pas zéro.
- Turnitin conseille aux enseignants de traiter le score comme une donnée isolée, et non comme une réponse définitive.
Si vous avez reçu un score de 100 % alors que vous avez écrit le texte vous-même, vous avez de quoi engager la discussion avec votre enseignant, et signalé, alors que vous l’avez écrit vous-même explique comment la préparer. Les avertissements officiels vous donnent des formulations précises à reprendre. Si vous disposez d’un rapport Turnitin et que vous voulez retravailler les passages signalés, importez le rapport et occupez-vous-en directement. Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE
Humaniser un texte IA sans en changer le sens : ce que dit le mécanisme
5 min de lecture
Outils et méthodesL'humaniseur IA qui fonctionne vraiment : ce que « fonctionne » signifie pour un détecteur
6 min de lecture
Détecteurs IASafeAssign contre la détection d'IA de Turnitin : ce que chacun vérifie vraiment
5 min de lecture