Quelle est la fiabilité d'un score d'IA Turnitin sur les documents courts ?
Si votre travail ne fait que quelques centaines de mots, un score d'IA Turnitin ne se comporte pas comme sur une dissertation longue. Turnitin dit elle-même que la prédiction sur les documents courts est principalement « all or nothing » (tout ou rien), parce qu'un seul segment est examiné. Sous 300 mots, il n'y a tout simplement pas de score : les exigences relatives aux fichiers fixent ce plancher. Cet article explique les déclarations officielles, pourquoi un contenu mixte peut sembler entièrement généré par l'IA, et comment lire le score d'un document court sans y réagir de façon excessive.
L'équipe HumanPen
· 4 min de lecture
Ce que dit Turnitin au sujet des copies courtes
La formulation de Turnitin elle-même sur les documents courts est directe : « In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents plus courts où il n'y a que quelques centaines de mots, la prédiction sera surtout « tout ou rien », car nous effectuons la prédiction sur un seul segment, sans possibilité de chevauchement.)
Cette phrase vient de la FAQ de Turnitin sur la détection de l'écriture par IA. Elle décrit ce qui arrive à la prédiction lorsqu'il n'y a pas assez de texte : le modèle ne nuance pas, il tranche. Une copie courte a tendance à être jugée dans son ensemble plutôt que phrase par phrase.
Cela compte, car l'essentiel de ce que les gens supposent au sujet des scores d'IA vient de longues dissertations. Sur un document long, le détecteur travaille sur de nombreux segments et le pourcentage peut refléter un mélange. Sur un document court, il y a moins de place pour ce genre de nuances.
Pourquoi le résultat est tout ou rien
La raison tient au mécanisme. Turnitin le décrit ainsi : « sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. » (Les phrases de la copie sont extraites et découpées en sections chevauchantes pour l'analyse de prédiction. Chaque section est classée par le modèle de détection d'IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit humain ou généré par l'IA.)
Sur une copie longue, ces sections chevauchantes donnent au modèle de nombreuses occasions d'examiner les mêmes phrases sous des angles différents. Les scores des phrases sont regroupés puis agrégés dans le score du document, ce qui lisse le résultat — la même agrégation que celle décrite dans ce que vérifie la détection d'IA de Turnitin et comment le score est construit.
Avec seulement quelques centaines de mots, il n'y a pour ainsi dire qu'une seule section. Pas de chevauchement, pas de regroupement de plusieurs points de vue. Le score du document reprend le jugement d'une seule classification, et c'est pourquoi la prédiction se rapproche du « tout » ou du « rien » plutôt que d'un entre-deux.
Un contenu mixte peut être noté comme entièrement généré par l'IA
La conséquence est énoncée dans la phrase suivante de Turnitin : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu'un texte mêlant du contenu généré par l'IA et du contenu original peut être signalé comme entièrement généré par l'IA.)
Ainsi, dans une copie courte, une page écrite en grande partie par vous qui contient un passage généré par l'IA peut être notée comme si tout venait de l'IA. Le modèle n'a pas assez de sections pour séparer les deux. Il ne dit pas que chaque partie du document a été générée par l'IA ; il dit que la prédiction s'est effondrée sur un seul jugement — l'une des voies par lesquelles un score d'IA Turnitin de 100 % peut tout de même être écrit par un humain.
C'est pourquoi deux copies courtes contenant la même proportion réelle de texte généré par l'IA peuvent finir par se ressembler si peu. Le score n'est pas une mesure précise de la part du document écrite par l'IA. C'est une prédiction faite sur un matériau limité.
Sous 300 mots, il n'y a aucun score à lire
Il y a une phrase que les gens citent ici, et son origine importe. Turnitin a écrit, dans une note de mise à jour datée du 15 décembre 2023 : « our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate. » (Notre précision augmente avec un peu plus de texte, si bien que les copies de moins de 300 mots peuvent donner un score d'écriture IA probablement moins précis.) Cette note s'intitule « AI writing detection processing bug fix, » (correction d'un bogue de traitement de la détection de l'écriture IA), le paragraphe qui précède la phrase indique « This issue has now been resolved, » (ce problème a maintenant été résolu), et le bogue consistait en ceci : des copies de moins de 300 mots étaient tout de même traitées. La phrase décrit des rapports générés entre le 6 et le 15 décembre 2023.
Ce qui la rend difficile à appliquer aujourd'hui. Le bogue corrigé, une copie de moins de 300 mots de prose n'obtient pas un score moins précis. Elle n'obtient aucun score. Les exigences actuelles relatives aux fichiers disent qu'un fichier « must have at least 300 words of prose text in a long-form writing format, » (doit comporter au moins 300 mots de texte en prose dans un format d'écriture long), donc si vous êtes sous ce plancher et que vous vous préparez à un pourcentage peu fiable, ce que vous verrez en réalité, c'est l'absence de AI Writing Report. La question de savoir quelle part d'une copie compte comme du texte est une autre question, traitée dans ce qui est considéré comme texte éligible dans la détection d'IA de Turnitin.
Si vous avez devant vous une copie très courte, le chiffre du rapport doit être traité comme un indicateur approximatif, et non comme une mesure.
Comment lire le score d'un document court
La recommandation de Turnitin pour toute personne qui lit un score d'IA est la même, que le document soit long ou court : « the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors. » (Le pourcentage de l'indicateur d'écriture IA ne doit pas être utilisé comme seul fondement d'une décision ni comme mesure de notation définitive par les enseignants.)
Sur les documents courts, cela compte encore plus, parce que le score est à la fois tout ou rien et moins précis. Une réaction lourde au score d'un document court traite une prédiction approximative comme si c'était un fait mesuré. Turnitin dit aussi que le score « is not meant to provide definitive answers in isolation, » (n'est pas destiné à fournir des réponses définitives isolément), et que la personne qui le lit doit mettre ce chiffre en balance avec sa connaissance personnelle de l'étudiant et de son travail. Ses pages destinées aux enseignants vont plus loin et exposent ce qu'un enseignant est invité à faire lorsque le pourcentage d'IA est élevé.
La lecture pratique est simple. Un score bas sur une copie courte mérite une question ; un score élevé sur une copie courte en mérite une aussi, avant que quiconque n'en fasse un verdict sur l'ensemble du texte.
CONTINUER LA LECTURE
Turnitin détecte-t-il l'IA dans la poésie, les scripts et les bibliographies annotées ?
5 min de lecture
Rapports de détectionPourquoi personne ne peut dire quel humaniseur est sûr
5 min de lecture
Rapports de détectionPourquoi mon établissement n’affiche-t-il aucun score d’IA sur Turnitin ?
4 min de lecture