Les 4 % de faux positifs par phrase de Turnitin : ce que ce chiffre signifiait en 2023

L'explication publiée par Turnitin en juin 2023 donnait un chiffre d'environ 4 % par phrase. L'objectif inférieur à 1 % par document mesure autre chose. Les 20 % sont un seuil de détection, pas une condition de présence réelle de texte d'IA ; aucun des deux chiffres ne détermine qui a écrit un passage précis.

L'équipe HumanPen

· 5 min de lecture

Ce à quoi renvoient réellement les 4 %

Dans son explication de juin 2023, Turnitin décrivait environ 4 % des phrases déjà signalées comme écrites par l'IA comme pouvant être humaines. C'est une statistique sur les phrases signalées, pas une probabilité calibrée pour une phrase précise de votre rapport actuel. Ce n'est pas non plus la proportion de toutes les phrases humaines qui seront signalées.

La directrice produit de Turnitin, Annie Chechitelli, l'expliquait ainsi en juin 2023 :

« Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content. » (Notre taux de faux positifs au niveau de la phrase est d'environ 4 %. Cela signifie qu'il y a 4 % de chances qu'une phrase précise signalée comme écrite par l'IA soit en réalité écrite par un humain. Le phénomène est plus fréquent dans les documents qui mêlent du contenu écrit par un humain et de l'IA, en particulier aux transitions entre les deux.)

La condition est que la phrase ait déjà été signalée. Le taux de faux positifs par document mesure, lui, la fréquence à laquelle des documents humains déclenchent une règle de détection. Les dénominateurs sont différents : un pourcentage ne peut donc pas être converti en l'autre.

Le taux au niveau du document est un autre chiffre

Le même billet de juin 2023 donne aussi un chiffre par document :

« Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing. » (Notre taux de faux positifs par document, soit l'identification erronée d'un texte entièrement humain comme généré par l'IA, est inférieur à 1 % lorsque le critère de classification exige un résultat de détection d'écriture par l'IA d'au moins 20 %.)

La formulation peut induire en erreur : les 20 % désignent ce qu'indique le détecteur, pas une quantité connue de texte d'IA réellement présente. Le livre blanc d'août 2024 de Turnitin décrit une règle de décision où plus de 20 % des scores des phrases dépassent un seuil du modèle. Il teste les faux positifs sur des travaux étudiants antérieurs à 2019, décrits comme entièrement humains. Un faux positif correspond à l'un de ces travaux humains qui franchit le seuil de détection.

Ce que les taux disent d'un devoir que vous avez écrit vous-même

Les travaux entièrement humains sont précisément ce qu'exige un test de faux positifs par document. Le seuil de 20 % utilisé par la règle de détection ne les exclut pas du test.

Le billet de 2023 indique que les phrases signalées à tort sont plus fréquentes dans les documents mixtes, surtout aux transitions entre texte humain et texte d'IA. Plus fréquentes ne veut pas dire exclusives. Cela n'exclut pas les faux signalements dans des travaux entièrement humains.

L'objectif inférieur à 1 % décrit la fréquence à laquelle des documents humains déclenchent la règle indiquée dans les conditions de test du fournisseur. Il ne signifie pas qu'un devoir signalé a moins de 1 % de chances d'être humain. Ce serait inverser la condition mesurée.

Les deux chiffres aident à comprendre qu'une erreur est possible. Aucun n'identifie l'auteur de votre passage précis. Examinez le texte signalé et le processus de rédaction plutôt que de prendre un taux pour un verdict.

Là où se concentrent les faux signalements

Turnitin a donné une donnée précise sur l'endroit où apparaissent ces phrases signalées à tort :

« As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing. » (Comme je l'expliquais dans mon article précédent, il existe une corrélation entre ces phrases et leur proximité, dans le document, avec du texte réellement écrit par l'IA. Dans 54 % des cas, ces phrases se trouvent juste à côté d'un texte réellement écrit par l'IA.)

Ces phrases sont des phrases humaines signalées à tort. D'après l'explication de 2023, 54 % se trouvaient à côté de texte réellement écrit par l'IA. Cela décrit une concentration observée d'erreurs, pas une règle couvrant tous les faux positifs.

Cette observation ne permet pas de diagnostiquer la cause d'un signalement dans votre devoir. Elle ne prouve pas la présence de texte d'IA à proximité et n'exclut pas une erreur en son absence. Les passages signalés peuvent guider la vérification ; une statistique de proximité ne peut pas établir qui a écrit le texte.

Comment Turnitin dit qu'il faut lire un signalement

Le même billet affirme clairement qu'un surlignage est un point de départ et non un résultat — et il le dit aux enseignants, c'est-à-dire exactement à ceux que vous voulez voir le lire :

« Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion. » (Considérez les phrases surlignées comme des zones d'intérêt, car elles sont censées se situer à proximité de l'endroit où se trouve de l'écriture par l'IA. Mais dans un faible pourcentage des cas, le modèle d'IA peut se tromper. Utilisez donc cette information pour engager une conversation, et non pour tirer une conclusion.)

Il écarte aussi ce à quoi les étudiants croient le plus souvent être mesurés. Il n'existe aucun chiffre à atteindre :

« Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score. » (Rappelez-vous qu'il n'existe pas de score « bon » ni de score « cible » avec l'indicateur d'écriture par l'IA, tout comme avec le Similarity Score.)

Que faire d'un rapport qui compte deux phrases

Rien de tout cela ne vous dit si vous avez un problème, parce qu'aucun chiffre publié ne le peut. Ce que cela vous donne, en revanche, c'est un moyen de garder la conversation sur le rapport lui-même plutôt que sur un pourcentage.

  • Demandez quels passages, et obtenez le rapport plutôt qu'une capture d'écran. Deux phrases surlignées et un chiffre au niveau du document sont deux objets différents. Les surlignages sont la seule partie à laquelle on puisse attacher un emplacement précis.
  • Demandez quel taux est cité et ce qu'il mesure. Le seuil de 20 % concerne la sortie du détecteur. Le taux de faux positifs par document se mesure sur des travaux humains ; ce n'est pas la probabilité que votre devoir précis, déjà signalé, soit humain.
  • Emportez avec vous la consigne de Turnitin elle-même. Elle demande aux enseignants de se servir d'un surlignage pour ouvrir une conversation, et non pour parvenir à une conclusion. Cette phrase s'adresse à la personne qui détient votre rapport, et elle est citée plus haut mot pour mot.
  • Conservez ce qui montre comment le devoir a été écrit — les brouillons, l'historique des versions, les notes, vos lectures. Voilà qui constitue une preuve de paternité. Un pourcentage n'en est pas une.

CONTINUER LA LECTURE