Que signifie l'astérisque (\*%) sur un score d'IA Turnitin ?
L'astérisque signifie que le détecteur a trouvé quelque chose entre 1 % et 19 % d'IA et qu'il retient le nombre et les surlignements. La raison est les faux positifs, et la conséquence est que la bande où atterrissent les scores de la plupart des gens est justement celle que le rapport refuse de vous montrer.
L'équipe HumanPen
· 11 min de lecture
La réponse courte
L'astérisque signifie que le détecteur de Turnitin a trouvé de l'IA dans la plage de 1 % à 19 % et qu'il ne vous montre ni le nombre ni les surlignements. La raison, dans les propres mots de Turnitin, est que les scores dans cette bande portent un risque plus élevé de faux positifs. Le rapport ne dit donc pas « rien de détecté » et ne dit pas « zéro ». Il dit : quelque chose a été trouvé, et nous ne allons pas vous le montrer. Cela a une conséquence concrète pour quiconque essaie de lire ou de réviser à partir d'un résultat dans cette plage, car les deux choses dont vous auriez besoin pour agir sur un score sont toutes deux absentes. Le nombre est absent, et les passages surlignés sont absents.
La règle, dans les propres mots de Turnitin
Voici la réponse complète de la FAQ sur les capacités de détection d'écriture par IA de Turnitin :
"To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range. When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed." (Pour éviter une incidence potentielle de faux positifs, aucun score ni surlignement n'est attribu00e9 pour les scores de détection d'IA dans la plage de 1 %à 19 %. Quand l'IA est détectée sous le seuil de 20 % dans le rapport, elle est désormais indiquée par un astérisque (*%) et aucun pourcentage n'est attribué.)
Trois choses sont condensées dans cette phrase, et la deuxième est généralement omise.
Premièrement, l'astérisque n'est pas un substitut de zéro. Il couvre tout de 1 %à 19 %. Un rapport affichant un astérisque a derrière lui un résultat non nul, et le rapport a décidé de ne pas révéler quel nombre non nul.
Deuxièmement, la raison est les faux positifs. La règle existe parce que Turnitin estime que les scores dans cette bande sont plus susceptibles d'être erronés, où « erroné » signifie marquer du texte écrit par une personne comme de l'IA. La phrase deux paragraphes plus haut dans la FAQ emploie l'expression "incorrectly flagging human-written text as AI-generated" (marquer à tort du texte écrit par une personne comme généré par IA) pour décrire ce qu'est un faux positif, et la règle de l'astérisque est la réponse directe à ce risque.
Troisièmement, le seuil est de 20 %. Vingt est là où le rapport se remet à se comporter comme une mesure. En dessous de vingt, il se comporte comme un commutateur avec une position pour zéro et une pour tout le reste. L'astérisque est l'un des quatre états d'indicateur que le rapport peut afficher ; c'est le seul qui dit qu'on a trouvé quelque chose sans le révéler.
Ce que la règle retire
L'astérisque supprime deux types d'information, et le second reçoit moins d'attention qu'il n'en mérite.
Le nombre disparaît. Tout le monde le remarque. Le pourcentage qui se serait trouvé entre 1 % et 19 % est remplacé par un symbole, et il n'y a aucun moyen de lire le chiffre réel dans le rapport.
Les surlignements disparaissent aussi. Avec un score de 20 % ou plus, le rapport marque les passages qu'il estime écrits par IA et vous pouvez aller les voir. Avec un astérisque, il n'y a rien à voir. Aucun passage n'est marqué. Aucune localisation au niveau de la phrase n'est donnée. Le rapport a un résultat qu'il ne vous montre pas, et il ne vous montre pas non plus d'où il vient.
Poussons cela jusqu'à une révision. Supposons qu'une version antérieure du document soit revenue à 17 % et l'actuelle à 3 %. Les deux rapports affichent un astérisque. Même symbole, même absence de surlignements, même chose à l'écran. Le travail a été fait. L'interface n'a pas de vocabulaire pour le signaler. Qui vous dit qu'un rapport actuel est passé « de 15 %à 4 % » fournit deux chiffres que le rapport n'a pas révélés. Ce n'est pas une lecture du rapport ; c'est une affirmation sur ce qui se trouve derrière.
C'est aussi pourquoi comparer deux astérisques n'est pas une comparaison. Deux rapports avec le même symbole peuvent avoir des résultats sous-jacents différents, et aucun ne vous dit si c'est le cas. Si vous devez comparer deux versions d'un document, les rapports comparables sont ceux à 20 % et au-dessus, où le nombre et les surlignements sont tous deux visibles. Nous avons détaillé à quoi ressemble une comparaison lisible dans comment lire un rapport d'écriture par IA Turnitin.
Pourquoi l'astérisque et l'effet « tout ou rien » partagent une frontière
La règle de l'astérisque porte sur l'affichage. Il existe une caractéristique distincte du modèle qui rend la bande derrière l'astérisque moins prévisible que ne l'aurait été le nombre qu'elle remplace, et elle se situe sur la même frontière.
Tiré de la FAQ, sur les documents courts :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts où il n'y a que quelques centaines de mots, la prédiction sera pour l'essentiel « tout ou rien » car nous prédisons sur un segment unique sans possibilité de chevauchement.)
La phrase suivante :
"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." (Cela signifie qu'un texte qui est un mélange de contenu généré par IA et de contenu original pourrait être signalé comme entièrement généré par IA.)
Un document court au contenu mixte peut donc obtenir un résultat qui ressemble à une chose alors que la situation sous-jacente est une autre. Si le score rapporté pour un tel document avait été, mettons, de 14 %, l'image réelle pourrait être plus compliquée que ne le suggérait le 14 %. L'astérisque cache ce 14 %, et ce faisant il cache aussi le fait que ce 14 % lui-même était une prédiction tout ou rien sur un segment unique.
Rien de tout cela n'est une déclaration sur la faute. C'est une déclaration sur ce que l'outil peut et ne peut pas vous dire dans la bande qu'il refuse de montrer. La conséquence pour le lecteur est qu'un astérisque sur un document court est l'état le moins informatif que le rapport puisse présenter tout en disant que quelque chose s'est passé. Et la seule chose que le rapport dit, il la dit sans contexte.
Sur quoi le pourcentage aurait été calculé
Une autre chose que l'astérisque cache, c'est la taille du dénominateur derrière, et ce dénominateur est plus étroit que le fichier.
Turnitin dit n'analyser que le texte éligible, que la FAQ définit ainsi :
"This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures." (Ce texte éligible ne comprend que des phrases en prose, c'est-à-dire que nous n'analysons que des blocs de texte rédigés en phrases grammaticales standard et n'incluons pas d'autres types d'écriture comme les listes, les puces (structures courtes qui ne sont pas des phrases) ou d'autres structures qui ne sont pas des phrases.)
La phrase suivante :
"This percentage is not necessarily the percentage of the entire submission." (Ce pourcentage n'est pas nécessairement le pourcentage de l'ensemble de la soumission.)
Un document composé surtout de listes, de tableaux et d'une bibliographie laissait donc au modèle très peu de prose à noter. L'astérisque sur un tel fichier se trouve sur un dénominateur déjà plus petit que le document ne le laisse paraître. Si le chiffre caché était 8 %, ces 8 % étaient 8 % de prose éligible, et la prose éligible pouvait représenter la moitié du fichier.
Cela importe pour deux raisons. Le pourcentage que le rapport ne vous montre pas n'est pas celui que vous devineriez en lisant le document. Et les surlignements que le rapport ne vous donne pas auraient été le seul moyen de savoir ce qui comptait. Sans les surlignements, le dénominateur sur lequel l'astérisque a été calculé est aussi invisible. Vous avez un symbole qui représente un nombre qui représente une fraction de quelque chose que vous ne pouvez pas mesurer de l'extérieur.
Pourquoi cacher la bande est cohérent avec le réglage du modèle
La règle de l'astérisque est une décision d'affichage, mais elle se pose sur un choix de conception plus profond qui va dans la même direction. Voici Turnitin sur ce choix :
"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing." (Afin de maintenir ce faible taux de 1 % de faux positifs, il existe une chance que nous passions à côté de texte écrit par IA dans un document. Nous l'acceptons car nous ne voulons pas surligner à tort du texte écrit par une personne comme écrit par IA. Par exemple, si nous identifions que 50 % d'un document est probablement écrit par un outil d'IA, il pourrait contenir jusqu'à 65 % d'écriture par IA.)
Lisez cela à côté de la règle de l'astérisque. Le modèle penche vers attraper moins plutôt que marquer trop. La règle d'affichage prend la bande où les deux erreurs sont les plus difficiles à séparer et refuse d'y mettre un nombre. C'est la même direction. Un outil qui préférerait manquer du texte d'IA plutôt que marquer du texte humain est aussi un outil qui préférerait montrer un astérisque plutôt qu'un 7 % qu'il ne peut pas assumer.
Le taux de faux positifs que publie Turnitin est spécifique sur la portée. De la même FAQ :
"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing." (Nous nous efforçons de maximiser l'efficacité de notre détecteur tout en maintenant notre taux de faux positifs — identifier à tort du texte entièrement écrit par une personne comme généré par IA — sous 1 % pour les documents contenant plus de 20 % d'écriture par IA.)
La phrase suivante :
"In other words, we might flag a human-written document as AI-written for one out of every 100 fully-human written documents." (En d'autres termes, nous pourrions signaler un document écrit par une personne comme écrit par IA pour un document sur 100 entièrement écrits par des personnes.)
La proposition à la fin de la première phrase est celle qui relie à l'astérisque. L'objectif de moins de 1 % est énoncé pour les documents contenant plus de 20 % d'écriture par IA. Sous ce seuil, l'objectif n'est pas donné comme un nombre, et c'est la règle d'affichage qui y répond : le rapport ne présente simplement pas les scores qu'il ne peut pas assumer. La frontière des 20 % dans la règle de l'astérisque et la frontière des 20 % dans l'objectif de faux positifs sont la même ligne.
Ce que vous pouvez faire avec un rapport à astérisque
Un astérisque est un résultat qui n'est ni blanc ni un nombre et qui ne vous laisse pas de passage à inspecter. Cela restreint ce qu'on peut en faire directement, mais ne laisse pas sur rien.
- Ne le traitez pas comme zéro. Le rapport a trouvé quelque chose. Il retient le chiffre, il ne le nie pas. Si on vous interroge sur un astérisque, la question est ce qui a été trouvé, pas si quelque chose a été trouvé.
- Demandez la date de génération. Les rapports sont produits selon les règles en vigueur au moment de leur génération, et une capture d'un astérisque sans date ne vous dit rien sur la règle qui l'a produit. Cela vaut aussi pour les autres états du rapport : le fichier est un instantané, pas une lecture en direct.
- Demandez ce qu'il y a d'autre dans le rapport. Turnitin dit que l'indicateur et le rapport de détection d'écriture par IA ne sont pas visibles par les étudiants et qu'un enseignant doit télécharger et partager le PDF. L'astérisque est un élément d'un document qui contient aussi le score Similarity, les informations de fichier et les notes de traitement. Lire le reste peut clarifier si ce que vous voyez est actuel et de quel rapport il s'agit.
- N'essayez pas de comparer deux astérisques. Les rapports comparables sont ceux à 20 % et au-dessus, où le nombre et les surlignements sont tous deux visibles. Deux astérisques peuvent représenter des chiffres sous-jacents différents et aucun des rapports ne vous dira si c'est le cas.
Si un rapport revient à 20 % ou plus, c'est la bande où le rapport vous donne quelque chose sur quoi agir : un chiffre et des passages surlignés. Une réécriture guidée par le rapport importe ces passages comme son périmètre, et seuls ces passages sont touchés. Si un rapport ultérieur signale encore des passages, ceux-ci peuvent être repassés sans frais. Sous 20 %, il n'y a pas de surlignements à importer, donc la question ne se pose pas.
Rien de tout cela n'est une prévision. Turnitin n'a jamais dit comment une édition donnée devrait faire bouger un score, et la règle de l'astérisque signifie que sous 20 % personne ne pourrait vérifier une telle affirmation. Ce que décide une réécriture guidée par le rapport, c'est quels mots sont touchés et lesquels restent exactement tels qu'ils ont été écrits.
Questions fréquentes
L'astérisque signifie-t-il que mon score est zéro ? Non. L'astérisque couvre la plage de 1 %à 19 %. Turnitin dit "no score or highlights are attributed for AI detection scores in the 1% to 19% range" (aucun score ni surlignement n'est attribué pour les scores de détection d'IA dans la plage de 1 %à 19 %) et que les scores dans cette bande "are now indicated with an asterisk (*%) and no percentage is attributed" (sont désormais indiqués par un astérisque (*%) et aucun pourcentage n'est attribué). Zéro est un état séparé avec son propre indicateur. L'astérisque signifie que quelque chose a été trouvé et que le nombre est retenu.
Pourquoi Turnitin affiche-t-il un astérisque au lieu d'un nombre ? Pour éviter les faux positifs. La FAQ de Turnitin dit "To avoid potential incidence of false positives, no score or highlights are attributed for AI detection scores in the 1% to 19% range." (Pour éviter une incidence potentielle de faux positifs, aucun score ni surlignement n'est attribué pour les scores de détection d'IA dans la plage de 1 %à 19 %.) Les scores dans cette bande portent un risque plus élevé de faux positifs, donc le rapport refuse de les présenter.
Puis-je connaître le vrai nombre derrière l'astérisque ? Pas depuis le rapport. Le nombre et les surlignements sont tous deux retenus dans cette bande. Il n'y a aucun moyen de lire le chiffre sous-jacent dans un rapport actuel affichant un astérisque.
Puis-je comparer deux rapports qui affichent tous deux un astérisque ? Pas de manière significative. Deux astérisques peuvent avoir des scores sous-jacents différents et aucun des rapports ne vous dit si c'est le cas. Les rapports comparables sont ceux à 20 % et au-dessus, où le nombre et les surlignements sont tous deux visibles.
L'astérisque signifie-t-il que le rapport est cassé ? Non. C'est une règle d'affichage, pas une erreur. Un double tiret gris séparé signifie que le fichier n'a pas pu être traité, et un point d'exclamation signifie que le traitement a échoué. L'astérisque signifie que le traitement a réussi et que quelque chose a été trouvé, et que le résultat est retenu.
20 % est-il la frontière où l'astérisque s'arrête ? Oui. À 20 % et au-dessus, le rapport affiche un nombre et des passages surlignés. Sous 20 %, le seul nombre exact que le rapport présente est 0 %. Tout entre 1 % et 19 % est l'astérisque. Nous avons traité ce que 20 % signifie comme frontière dans 20 % d'IA est-il trop élevé ?.
CONTINUER LA LECTURE
Votre essai en anglais affiche un taux d'IA trop élevé ? Commencez par lire le rapport
13 min de lecture
Rapports de détectionComment prouver que vous n’avez pas utilisé l’IA : l’historique des versions dans Word et Google Docs
13 min de lecture
Rapports de détectionComment prouver que votre travail est original lorsqu'un détecteur d'IA donne un faux positif
16 min de lecture