Perplexité et burstiness expliquées : quels détecteurs d’IA les utilisent
La perplexité et la burstiness sont de vraies mesures, mais GPTZero indique ne plus les utiliser pour la détection depuis l’automne 2023, et Turnitin affirme que son modèle n’a jamais été explicitement programmé pour les évaluer. Voici ce que chaque terme désigne, et ce qu’il vous reste pour réviser.
L'équipe HumanPen
· 5 min de lecture
Ce que signifie la perplexité
La perplexité mesure la prévisibilité des mots. Lorsqu’un modèle de langage lit une phrase, il attribue à chaque mot une probabilité qui dépend des mots qui le précèdent. Si le mot suivant est hautement prévisible, la perplexité de ce mot est faible. S’il est inattendu, la perplexité est élevée. La perplexité d’un texte entier correspond essentiellement à la moyenne du degré de prévisibilité des choix de mots sur l’ensemble du texte.
Voici une façon de le comprendre. Si vous écrivez « L’expérience a montré un important », le mot suivant a de fortes chances d’être « résultat », « écart » ou « effet ». Ce sont des mots à forte probabilité. Si le mot suivant est « ananas », c’est un mot de faible probabilité, et la perplexité à cet endroit grimperait en flèche. Un texte qui choisit systématiquement le mot le plus attendu a une perplexité globale faible. Un texte qui fait des choix inattendus a une perplexité plus élevée.
Les textes générés par IA ont tendance à avoir une perplexité faible, parce que les modèles de langage sont conçus pour choisir le mot suivant le plus probable. Ils optimisent la probabilité contextuelle, ce qui fait que leurs choix de mots suivent des schémas prévisibles. L’écriture humaine, à l’inverse, contient souvent des choix de mots moins prévisibles, des verbes inhabituels, des termes spécialisés ou des tournures qu’un modèle de langage n’aurait pas retenues. Cette différence est réelle et mesurable. La question est de savoir si tous les détecteurs d’IA utilisent la perplexité dans leur algorithme, et la réponse est non.
Ce que signifie la burstiness
La burstiness mesure la variation de la structure des phrases. Si toutes les phrases d’un paragraphe ont à peu près la même longueur, la même structure grammaticale et le même rythme, la burstiness est faible. Si les phrases varient fortement — certaines courtes et percutantes, d’autres longues et complexes, avec des subordonnées —, la burstiness est élevée.
L’écriture humaine a tendance à avoir une burstiness plus élevée que le texte généré par IA. Nous écrivons par à-coups. Nous mélangeons une phrase déclarative courte avec une plus longue qui contient une incidente. Nous rompons le schéma lorsque nous voulons appuyer un point. Les modèles d’IA produisent des structures de phrase plus uniformes, parce qu’ils optimisent la cohérence statistique. Le résultat est un texte qui se lit bien, mais avec moins de variation structurelle.
La burstiness s’est imposée comme mesure de détection parce qu’elle capte quelque chose de réel dans la façon dont l’écriture humaine et l’écriture par IA diffèrent. Les humains sont irréguliers ; les modèles d’IA sont constants. Un détecteur qui mesure la burstiness regarde si la structure de vos phrases varie assez pour paraître humaine. Comme la perplexité, la burstiness est un concept utile. Et comme la perplexité, ce n’est pas une mesure que tous les détecteurs calculent.
Quels détecteurs utilisent ces mesures
C’est GPTZero qui a mis les deux termes en circulation, et sa propre page se lit aujourd’hui sur deux niveaux. L’article de 2023 est toujours en ligne : il décrit la perplexité comme une mesure du caractère imprévisible d’un texte, la burstiness comme une mesure de la variation au niveau de la phrase, et les deux ensemble comme la couche statistique de son modèle de détection. En haut de cette même page, GPTZero indique qu’à partir de l’automne 2023, il n’utilise plus la perplexité ni la burstiness pour sa détection d’IA, après être passé à une architecture d’apprentissage profond. Les deux termes restent utiles à connaître : ils nomment quelque chose de réel dans un texte. Ce qu’ils ne décrivent plus, c’est la façon dont ce détecteur tranche.
Turnitin adopte une autre approche. Sa FAQ officielle indique : « Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. » (Notre modèle n’est pas explicitement programmé pour évaluer des signaux particuliers tels que 'burstiness', 'perplexity' ou d’autres mesures individuelles parfois évoquées dans les débats publics.) La phrase suivante précise : « Instead, it learns statistical patterns from our training data. » (Il apprend plutôt des schémas statistiques à partir de nos données d’entraînement.) C’est une négation directe et explicite du fait que Turnitin calcule ces deux mesures.
Cette distinction compte, parce que les deux outils classent parfois le même texte différemment — mais pas pour la raison qu’on avance d’habitude. Un texte conçu pour avoir une burstiness et une perplexité élevées vise une cible qu’aucun des deux éditeurs ne dit calculer aujourd’hui : GPTZero affirme avoir cessé d’utiliser ces mesures à l’automne 2023, et Turnitin affirme que son classifieur a appris des schémas à partir des données d’entraînement sans calculer aucune des deux. Les conseils qui disent « augmentez votre burstiness » ou « baissez votre perplexité » sont calibrés pour l’époque statistique de la détection, et la documentation publique des deux éditeurs ne permet pas de vérifier s’ils changent encore quoi que ce soit.
Ce que Turnitin utilise à la place
Si Turnitin ne calcule ni la perplexité ni la burstiness, qu’utilise-t-il ? La documentation décrit un classifieur qui apprend des schémas statistiques à partir des données d’entraînement, puis les applique à des segments de votre texte.
Turnitin indique : « Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions. Instead, it learns statistical patterns from our training data. » (Notre modèle n’est pas explicitement programmé pour évaluer des signaux particuliers tels que 'burstiness', 'perplexity' ou d’autres mesures individuelles parfois évoquées dans les débats publics. Il apprend plutôt des schémas statistiques à partir de nos données d’entraînement.) Le classifieur n’applique ni formule de perplexité ni formule de burstiness. Il applique des schémas intériorisés pendant l’entraînement, des schémas qui portent sur la probabilité des mots mais ne se réduisent pas à un seul score nommé.
La même page de FAQ confirme sur quoi le classifieur se concentre : « Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers. » (Nos classifieurs sont entraînés à détecter ces différences de probabilité des mots et maîtrisent les séquences de probabilité de mots propres aux rédacteurs humains.) La probabilité des mots est au cœur de ce que le classifieur de Turnitin a appris, mais le modèle la traite à travers des schémas appris, et non par un calcul explicite de perplexité.
Le mécanisme fonctionne par segments. Turnitin le décrit ainsi : « When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. » (Lorsqu’un devoir est soumis à Turnitin, les phrases du dépôt sont extraites et segmentées en sections chevauchantes pour l’analyse de prédiction. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, indiquant la probabilité que le texte soit plutôt humain ou généré par IA.) Les segments se chevauchent, les phrases héritent des scores, plusieurs scores sont regroupés, et l’agrégation finale produit le pourcentage au niveau du document. Cette chaîne de traitement ne comporte aucune étape où la perplexité ou la burstiness serait calculée.
Turnitin précise également : « As a result, its outputs are generated by many learned patterns working together rather than by a small set of transparent, human-readable rules. For that reason, individual predictions may not always be explainable in simple feature-by-feature terms. » (Par conséquent, ses résultats sont produits par de nombreux schémas appris travaillant ensemble, et non par un petit ensemble de règles transparentes et lisibles par un humain. C’est pourquoi les prédictions individuelles ne sont pas toujours explicables simplement, caractéristique par caractéristique.) Le processus de décision du modèle n’est pas quelque chose que l’on peut reconstituer en suivant une poignée de mesures.
La différence pratique pour votre écriture
La conclusion pratique est simple. Si vous lisez un conseil disant « baissez votre perplexité pour battre Turnitin », ce conseil repose sur une mauvaise compréhension de l’outil : Turnitin affirme que son modèle n’a jamais été explicitement programmé pour évaluer ce signal. Et les astuces bâties sur la burstiness et la perplexité relèvent de l’époque statistique de la détection, que GPTZero dit avoir quittée à l’automne 2023 ; elles ne correspondent plus à ce que l’un ou l’autre outil dit de lui-même aujourd’hui.
Le fond du problème, c’est que le classifieur de Turnitin n’utilise pas ces concepts comme mesures nommées. Il a appris des schémas statistiques à partir des données d’entraînement — des schémas qui contiennent une information sur la probabilité des mots — et les applique à votre texte. Vous ne pouvez pas optimiser une mesure que le classifieur ne calcule pas. Ce que vous pouvez faire, c’est écrire d’une manière qui reflète une réelle paternité humaine, avec une variation naturelle du choix des mots et de la structure, différente des schémas produits par les modèles d’IA.
Les passages éligibles peuvent être relancés gratuitement. Essayez ici.
CONTINUER LA LECTURE
Une traduction du chinois vers l'anglais est-elle signalée comme IA par Turnitin ?
5 min de lecture
Rapports de détectionGuide pour les étudiants chinois : réduire son score de détection IA Turnitin
5 min de lecture
Rapports de détectionLe mythe de perplexity et burstiness : ce que Turnitin utilise vraiment
5 min de lecture