Le tiret cadratin est-il un indice d’IA ?
L’observation qui sous-tend le conseil est juste. L’inférence qui en est tirée ne l’est pas, et le remède auquel on recourt est un rechercher-remplacer global sur un texte que l’on n’avait aucune autre raison de toucher.
L'équipe HumanPen
· 12 min de lecture
La réponse courte
Rien de ce que nous trouvons dans la documentation du fournisseur lui-même ne l’étaye, et la section suivante montre exactement où nous avons cherché. Nous avons fouillé trois des pages d’aide de Turnitin le 18 août 2026 : le guide de l’AI Writing Report, la FAQ sur les capacités de détection de l’écriture par IA et la page des exigences de fichier. Sur ces trois pages, la chaîne « dash » apparaît exactement une fois, à l’intérieur du mot « dashboard ». Le mot « punctuation » apparaît exactement une fois, dans une réponse qui explique que le détecteur « is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content » (n’est pas paramétré pour cibler les modifications d’orthographe, de grammaire et de ponctuation apportées au contenu par Grammarly). Et la page qui répond à la question « what parameters or flags does Turnitin's model take into account when detecting AI writing? » (quels paramètres ou indicateurs le modèle de Turnitin prend-il en compte pour détecter l’écriture par IA ?) y répond entièrement en termes de séquences de mots. Le conseil le plus affirmé au sujet d’un signe de ponctuation ne repose donc sur rien de ce que nous trouvons que l’entreprise qui a construit le détecteur ait dit à ce sujet.
Ce n’est pas la même chose que prouver qu’un tiret ne peut pas compter. Un modèle qui apprend des régularités statistiques n’a aucune obligation de publier ce qu’il a appris, et aucun document public n’exclut qu’un tiret apporte quelque chose. Ce qui manque, c’est l’autre moitié : rien de ce que nous avons trouvé ne justifie non plus de lui donner un poids. Pendant ce temps, le remède auquel on recourt — remplacer tous les tirets cadratins, partout — modifie presque tous les paragraphes d’un document, d’une seule frappe, sans que personne ne lise le résultat.
Deux affirmations différentes dans la même phrase
« Les tirets cadratins sont un indice d’IA » se dit comme si c’était une seule chose. Ce sont deux affirmations, et rien ne les relie :
- Le texte généré contient beaucoup de tirets cadratins. Une affirmation sur ce qui sort des modèles de langage. N’importe qui peut aller vérifier.
- Un tiret cadratin fait monter le score d’écriture par IA. Une affirmation sur ce qu’un classifieur particulier pondère. Personne en dehors du fournisseur ne peut le vérifier.
La première peut être entièrement vraie alors que la seconde est fausse, parce que le fait qu’un trait soit fréquent dans une population ne dit rien de la manière dont un détecteur entraîné sur les deux populations l’utilise. Les rédacteurs qui emploient beaucoup le tiret sont justement la population sur laquelle la seconde affirmation se tromperait, et rien dans la première ne vous dit ce qui leur arrive.
Nous ne sommes pas les premiers à dire la version générale de cela. Notre propre page sur ce que mesurent les détecteurs d’IA soutient qu’un passage n’obtient pas un score élevé à cause d’une habitude visible. Ce qui suit ici est plus étroit : nous sommes allés vérifier si cette habitude précise apparaît quelque part dans la documentation du fournisseur lui-même, car une affirmation aussi répandue devrait bien avoir un document derrière elle.
Ce que nous sommes allés chercher, et ce qu’il y avait
Trois pages, consultées le 18 août 2026, lues comme texte de page rendu et fouillées sans tenir compte de la casse : « Using the AI Writing Report » (Utiliser l’AI Writing Report), « Turnitin's AI writing detection capabilities FAQs » (FAQ de Turnitin sur les capacités de détection de l’écriture par IA) et « File requirements for an AI Writing Report » (Exigences de fichier pour un AI Writing Report). Ce sont les pages qui exposent le mécanisme et les règles de fichier ; les notes de version et les pages de problèmes connus ne faisaient pas partie de cette recherche. Les chiffres sont des occurrences, pas des lignes.
| Terme recherché (en anglais) | Guide de l’AI Writing Report | FAQ sur la détection IA | Exigences de fichier |
|---|---|---|---|
| dash | 0 | 1, dans « dashboard » | 0 |
| em dash | 0 | 0 | 0 |
| hyphen | 0 | 0 | 0 |
| punctuation | 0 | 1 | 0 |
| character | 0 | 0 | 0 |
| comma | 0 | 0 | 0 |
| « 300 words » (témoin) | 1 | 1 | 1 |
La dernière ligne est là parce qu’une recherche qui ne trouve rien et une recherche qui n’a jamais atteint la page se ressemblent vues de l’extérieur. Qu’une formulation dont nous savons qu’elle figure sur les trois pages renvoie un résultat chacune, voilà ce qui donne un sens aux zéros situés au-dessus.
Il reste donc un seul résultat réel. Voici la réponse complète dans laquelle il se trouve, à la question de savoir si la vérification grammaticale de Grammarly est signalée :
« No. Our detector is not tuned to target Grammarly-generated spelling, grammar, and punctuation modifications to content but rather, other AI content written by LLMs such as GPT-3.5. Based on tests we conducted on human-written documents with no AI-generated content in them, in most cases, changes made by Grammarly (free & premium) and/or other grammar-checking tools were not flagged as AI-written by our detector. Please note that this excludes content generated by Grammarly's generative AI-powered features, including draft generation, paraphrasing, summarizing, and other features. Content produced using these features will likely be flagged as AI-generated by our detector. » (Non. Notre détecteur n’est pas paramétré pour cibler les modifications d’orthographe, de grammaire et de ponctuation apportées au contenu par Grammarly, mais bien un autre contenu d’IA rédigé par des LLM tels que GPT-3.5. D’après les tests que nous avons menés sur des documents rédigés par des humains et ne contenant aucun contenu généré par IA, dans la plupart des cas, les modifications apportées par Grammarly (gratuit et premium) et/ou par d’autres outils de vérification grammaticale n’ont pas été signalées comme rédigées par IA par notre détecteur. Veuillez noter que cela exclut le contenu généré par les fonctions d’IA générative de Grammarly, notamment la rédaction de brouillons, le paraphrasage, la synthèse et d’autres fonctions. Le contenu produit à l’aide de ces fonctions sera probablement signalé comme généré par IA par notre détecteur.)
Lisez-la pour ce qu’elle est. Elle porte sur les corrections d’un correcteur grammatical, pas sur vos tirets ; elle dit « in most cases » (dans la plupart des cas) et non jamais, et les deux dernières phrases tirent fortement dans l’autre sens pour tout ce que Grammarly génère plutôt qu’il ne corrige. La frontière entre texte corrigé et texte généré est un sujet en soi, et nous l’avons tracée dans Turnitin détecte-t-il Grammarly ?. Elle ne sert ici qu’à une chose : au seul endroit de ces trois pages où la ponctuation et la détection apparaissent dans la même phrase, cette phrase éloigne du réglage au niveau de la ponctuation au lieu d’y conduire.
Il y a ensuite la question qui aurait répondu directement à la nôtre si la réponse allait dans ce sens. Sous le titre « What parameters or flags does Turnitin's model take into account when detecting AI writing? » (Quels paramètres ou indicateurs le modèle de Turnitin prend-il en compte pour détecter l’écriture par IA ?), le passage substantiel dit :
« Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers. » (Nos classifieurs sont entraînés à détecter ces différences de probabilité des mots et maîtrisent les séquences de probabilité de mots propres aux rédacteurs humains.)
Probabilité des mots. Séquences de mots. C’est le niveau auquel le fournisseur décrit le travail de ses propres classifieurs, dans la réponse qu’il donne quand sa propre FAQ demande de but en blanc ce que le modèle prend en compte.
Rien de publié ne nomme une unité plus petite que le mot
Suivez le vocabulaire vers le bas dans la description publiée de la façon dont un score est produit : il s’arrête avant d’atteindre le caractère :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1 … Each qualifying sentence within these segments inherits the segment's score. » (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites et segmentées en sections se chevauchant pour l’analyse de prédiction. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1 … Chaque phrase éligible à l’intérieur de ces sections hérite du score de la section.)
Des sections. Des phrases. Du texte éligible, que la même FAQ définit comme des blocs rédigés en phrases grammaticales standard. Des séquences de probabilité de mots. Chaque unité nommée dans cette chaîne est un mot ou plus, et la plus petite chose qui reçoit jamais un chiffre à elle est une étendue de plusieurs phrases, à laquelle une phrase emprunte ensuite ce chiffre.
Un tiret se trouve à l’intérieur de cette étendue. Retirez-le et la section contient toujours les mêmes mots dans le même ordre — c’est précisément ce qu’un échange de ponctuation ne modifie pas, et l’ordre des mots est ce que le fournisseur a nommé. Que le tokeniseur s’en soucie est une autre question, à laquelle personne hors de Turnitin ne peut répondre, et nous n’allons pas prétendre le contraire. Mais le conseil est presque toujours donné comme si le mécanisme était compris, et le mécanisme publié n’a pas de place pour cela.
Ce qu’un tiret change de façon démontrable
Il existe une conséquence mesurable de la suppression d’un tiret cadratin que vous pouvez vérifier vous-même dans les trente prochaines secondes, et elle n’a rien à voir avec la détection. Microsoft Word traite un tiret cadratin ou un tiret demi-cadratin comme une limite de mot et un trait d’union comme n’en étant pas une : « cost—benefit » compte donc pour deux mots et « well-known » pour un. Remplacez quarante tirets cadratins sans espaces par des traits d’union et votre nombre de mots baisse de quarante.
Pour la plupart des documents, c’est une curiosité. Pour un travail proche d’une limite stricte, non, et les exigences de fichier de Turnitin fixent elles-mêmes un plafond à ce qui sera traité : c’est pourquoi nous avons consacré une section aux tirets et aux compteurs de mots dans Turnitin peut-il vérifier une thèse entière ?. Remarquez la forme que cela prend : l’effet que nous pouvons réellement démontrer passe par un compteur de mots, pas par un classifieur.
Ce que leur suppression coûte
Un tiret cadratin fait un travail dans la phrase. Ce que vous mettez à sa place fait un autre travail, et le choix n’est pas cosmétique :
- Une virgule affaiblit la coupure. Là où le tiret portait une véritable interruption, la virgule la perd ou produit une virgule fautive entre deux propositions.
- Un point-virgule relève le registre et exige que ce qui suive se suffise comme proposition. Souvent, ce n’est pas le cas.
- Des parenthèses rétrogradent le contenu au rang d’incise. Cela change ce que vous affirmez sur son importance, ce qui, dans une section de discussion, est un argument et non une décision de mise en forme.
- Un point coupe une idée en deux. Parfois une amélioration. Parfois il rompt le lien qui faisait tout l’intérêt de la phrase.
- Rien du tout marche plus souvent qu’on ne l’imagine, et c’est la seule option de cette liste qui n’introduit pas de décision nouvelle.
Multipliez maintenant par le nombre de tirets que contient le document. Le rechercher-remplacer prend toutes ces décisions de la même façon, en une seule action, dans un texte que vous n’aviez aucune autre raison d’ouvrir. C’est la plus grande modification que la plupart des gens apporteront à un manuscrit terminé, et c’est celle qui est faite avec le moins d’attention.
Et si un guide de style régit votre document, la règle sur les tirets qui vous lie est celle de ce guide, pas celle d’un fil de discussion. Déterminer quels tirets sont cadratins et lesquels sont demi-cadratins est au moins une question qui a une réponse.
La partie de l’affirmation qui tient encore
Retirez la théorie sur les classifieurs et il reste quelque chose debout, mais cela désigne une personne plutôt qu’un score.
Beaucoup de lecteurs croient à la règle. Si votre directeur ou votre directrice en fait partie, vos tirets vous coûtent quelque chose de réel : une impression, formée dès la première page, avant qu’aucun détecteur n’intervienne. Ce risque ne dépend d’aucune explication du fonctionnement du logiciel, et c’est précisément pourquoi c’est la moitié la plus solide de l’affirmation. Nous pensons que c’est la moitié qui mérite d’être prise au sérieux, et nous le présentons comme notre lecture, pas comme quelque chose de publié.
Mais remarquez que le rechercher-remplacer y répond mal. Celui qui se fait une impression de votre texte réagit à une page, il ne compte pas les caractères, et le paragraphe qui lui a paru fabriqué par une machine lui fera le même effet avec des virgules. Ce qui touche un lecteur, c’est que le texte soit reconnaissablement vôtre et que vous puissiez en parler : c’est l’argument en faveur de la conservation des brouillons, et nous expliquons comment ces preuves sont réellement utilisées dans l’historique des versions comme preuve.
L’impression que votre style laisse à un lecteur et un résultat de détection d’IA sont deux types d’information différents. Turnitin indique que les étudiants ne peuvent pas consulter directement l’indicateur ni le rapport d’écriture par IA ; c’est à l’enseignant de le télécharger et de le transmettre. Procurez-vous le rapport, examinez les surlignages réels et servez-vous de vos brouillons et de vos traces d’écriture pour expliquer votre démarche, plutôt que de deviner le résultat à partir de la ponctuation.
Le faire à une échelle que vous pouvez lire
Quoi que vous décidiez au sujet des tirets, le principe utile est celui qu’un remplacement global viole : modifiez le texte à une échelle où vous pouvez encore lire ce qui a changé. Chaque modification non relue est un endroit où un document peut mal tourner sans bruit.
Cette contrainte, et non une quelconque opinion sur la ponctuation, est ce qui a façonné l’outil HumanPen. Donnez-lui le fichier plus un rapport d’IA de Turnitin ou iThenticate, et les passages signalés deviennent le périmètre ; tout ce qui est en dehors garde la formulation que vous avez écrite. Notre propre page énonce la règle de granularité sans détour : « a paragraph is the smallest unit a rewrite can touch, so a selection is expanded to full paragraphs before it is counted. » (un paragraphe est la plus petite unité qu’une réécriture puisse toucher ; une sélection est donc élargie à des paragraphes entiers avant d’être comptée). Un paragraphe se situe plusieurs niveaux au-dessus de l’objet de cet article.
Deux choses en découlent, qu’il vaut mieux énoncer comme des limites que comme des fonctionnalités. La facturation compte les mots réellement réécrits : un travail délimité coûte ce que coûte le périmètre, non ce que pèse le fichier. Les passages éligibles peuvent être relancés gratuitement.
Ce que nous ne pouvons pas faire, c’est vous donner un chiffre. La position de Turnitin elle-même sur son modèle est que les prédictions individuelles « may not always be explainable in simple feature-by-feature terms » (peuvent ne pas toujours être explicables en termes simples, caractéristique par caractéristique), et elle n’a rien publié qui associe une modification à un mouvement du score : un outil qui vous annonce un pourcentage résultant avance donc quelque chose qu’il n’a pas. En dessous du seuil, c’est pire, car les scores entre 1 % et 19 % sont affichés sous forme d’astérisque, sans pourcentage ni surlignage, ce qui signifie qu’une amélioration réelle dans cette plage est invisible pour tout le monde, vous compris. Si vous voulez les raisons pour lesquelles deux outils donnent des chiffres différents sur le même paragraphe, c’est dans pourquoi les détecteurs ne sont pas d’accord ; si vous avez un rapport entre les mains maintenant, commencez par comment lire un rapport d’écriture par IA de Turnitin.
Questions fréquentes
Supprimer tous les tirets cadratins fera-t-il baisser mon score d’IA ? Personne ne peut vous le dire, et quiconque répond oui ou non de façon catégorique va au-delà de ce qui est publié. Ce que nous pouvons rapporter, c’est que les trois pages d’aide de Turnitin que nous avons fouillées ne contiennent aucune mention des tirets, et que le seul endroit où la ponctuation y apparaît est une réponse disant que le détecteur n’est pas paramétré pour cibler les modifications de ponctuation.
Les modèles d’IA utilisent-ils vraiment plus de tirets cadratins que les humains ? C’est tout à fait possible, et c’est une affirmation que vous pouvez vérifier vous-même sur du texte généré. C’est une affirmation différente de « un détecteur les pondère », et elle ne l’implique pas.
Y a-t-il un effet mesurable à les retirer ? Un seul, que vous pouvez vérifier vous-même, et il ne concerne pas la détection. Word compte un tiret cadratin comme une limite de mot et un trait d’union comme n’en étant pas une : remplacer des tirets cadratins sans espaces par des traits d’union réduit donc votre nombre de mots d’une unité par remplacement.
Mon directeur a dit que mes tirets font penser à ChatGPT. Que faire ? Prenez-le comme l’impression d’un lecteur et non comme le résultat d’un détecteur, parce que c’est ce que c’est. À une impression, on répond par des brouillons, des notes et la capacité de parcourir sa propre argumentation, pas par un rechercher-remplacer qu’il ne remarquera pas.
Dois-je écrire autrement pour éviter tout ce problème ? Écrire délibérément en dessous de son propre niveau coûte à coup sûr des points et apporte un bénéfice non mesuré face à un score que vous n’êtes généralement pas autorisé à voir. La liste publiée par le fournisseur lui-même décrivant ses faux positifs — un texte avec peu de variation structurelle, un texte qui se répète littéralement — n’est pas une liste de ponctuation, et les retouches manuelles qu’elle appuie sont passées en revue dans comment humaniser un texte d’IA sans outil.
CONTINUER LA LECTURE
Pourquoi Turnitin dit que votre travail est écrit à 100 % par l'IA
11 min de lecture
Rapports de détectionPourquoi Turnitin signale-t-il mes références et mes citations ? Ce que les exclusions couvrent réellement
10 min de lecture
Rapports de détectionTurnitin a signalé toute ma section méthodologie
13 min de lecture