Comment humaniser un texte d’IA sans outil : les corrections qui font vraiment bouger les statistiques
Turnitin ne note pas des phrases isolées mais des segments qui se chevauchent et couvrent plusieurs phrases. Voici quelles corrections manuelles visent les propriétés que sa propre documentation nomme, et ce que ce travail à la main coûte réellement.
L'équipe HumanPen
· 14 min de lecture
La réponse courte
Deux tâches bien différentes portent le nom de « humaniser un texte d’IA ». La première consiste à faire passer un texte généré à travers un contrôle. La seconde, c’est la situation de la plupart des gens : le texte est le vôtre, ou il est parti d’un brouillon que vous avez ensuite réécrit, et il vous est revenu signalé quand même. Cette page parle de la seconde. Presque tout ce qui suit explique pourquoi la première est une cible mouvante.
Travaillez à l’échelle du passage entier. Turnitin découpe un dépôt en segments qui se chevauchent et couvrent plusieurs phrases, attribue un score à chaque segment, puis fait hériter à chaque phrase éligible le score des segments auxquels elle appartient : une modification limitée à une seule phrase se mesure donc au paragraphe qui l’entoure. Les trois propriétés que Turnitin cite dans ses propres faux positifs sont un texte sans grande variation structurelle, un texte qui se répète littéralement et un texte paraphrasé sans développer d’idées nouvelles. Cette liste est ce qui se rapproche le plus d’un cahier des charges publié pour le travail à la main.
Personne, nous y compris, ne peut vous annoncer le chiffre auquel votre score s’arrêtera. La plupart des conseils sur le sujet sont écrits comme si vous pouviez mesurer vous-même le résultat. En général, ce n’est pas possible, et une section plus bas y revient.
Ce que ce score met en chiffres
Le pourcentage d’écriture IA n’est pas un décompte de phrases suspectes. La FAQ de Turnitin décrit le traitement ainsi :
"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score." (Lorsqu’un devoir est soumis à Turnitin, les phrases du dépôt sont extraites et découpées en sections se chevauchant en vue de l’analyse de prédiction. Chaque segment est classé par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui désigne la probabilité que le texte soit probablement humain ou généré par IA. Chaque phrase éligible au sein de ces segments hérite du score du segment. Comme les segments se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un score unique. Ces scores de phrase sont ensuite agrégés et servent à calculer le score global d’écriture IA du document.)
Trois conséquences pratiques en découlent.
Une phrase n’a pas d’avis propre. Son score vient des blocs de texte auxquels elle appartient, et elle appartient à plusieurs. La phrase que vous avez sous les yeux porte donc peut-être un score fixé par ses voisines.
Seule la prose compte. Turnitin appelle cela le texte éligible et indique analyser « only blocks of text that are written in standard grammatical sentences » (uniquement les blocs de texte rédigés en phrases grammaticalement standard), et non les listes, les puces ou les autres structures qui ne sont pas des phrases. Il précise aussi que le chiffre obtenu « is not necessarily the percentage of the entire submission » (n’est pas nécessairement le pourcentage de l’ensemble du dépôt), et qu’un document mêlant plusieurs types d’écriture « would result in a disparity between the percentage and the highlights » (entraînerait un écart entre le pourcentage et les surlignages). Si les passages surlignés ne semblent pas correspondre au chiffre qu’on vous a donné, c’est la raison documentée, pas un dysfonctionnement. Nous en disons plus dans comment lire un rapport d’écriture IA Turnitin.
Et le score est rattaché au passage : c’est l’unité que lit le détecteur.
La seule liste de caractéristiques que Turnitin ait publiée
Tout le reste de cette page découle d’une seule phrase de cette FAQ :
"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Il arrive que des faux positifs — c’est-à-dire un texte écrit par un humain signalé à tort comme généré par IA — portent sur un contenu sans grande variation structurelle, un texte qui se répète littéralement ou un texte paraphrasé sans développer d’idées nouvelles.)
La phrase suivante compte tout autant : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur relève une quantité plus élevée d’écriture IA dans un tel texte, nous vous conseillons d’en tenir compte lorsque vous examinez le pourcentage indiqué.) Autrement dit, l’éditeur demande aux enseignants de relativiser les scores élevés sur ce type d’écriture.
Soyons clairs sur ce qu’est cette liste : Turnitin décrit les formes d’écriture humaine que son propre détecteur ne reconnaît pas correctement. Ce n’est pas une description du fonctionnement du modèle, et ce n’est pas une liste de contrôle pour déguiser un texte généré. C’est la description de la situation dans laquelle vous vous trouvez si vous avez écrit le texte vous-même et qu’il a tout de même été signalé. Trois propriétés nommées, trois corrections. Toute la méthode tient là.
L’explication populaire est plus étroite qu’elle n’en a l’air
Avant les corrections, évacuons cette question, car la moitié des conseils trouvés en ligne reposent dessus.
L’histoire habituelle, c’est que les détecteurs mesurent la burstiness et la perplexité, et que la prose académique obtient un mauvais score parce qu’elle est trop régulière. La même FAQ y répond : le modèle « is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions » (n’est pas explicitement programmé pour évaluer des signaux spécifiques tels que la « burstiness », la « perplexity » ou d’autres mesures individuelles parfois évoquées dans les discussions publiques). Elle indique plutôt que le modèle apprend des régularités statistiques à partir de ses données d’entraînement, et que chaque prédiction n’est pas toujours explicable caractéristique par caractéristique.
Attention à ne pas en tirer trop. La même page indique aussi que ses classifieurs sont entraînés à détecter des différences de probabilité des mots, or la perplexité est une mesure de la probabilité des mots. La version exacte est donc étroite : Turnitin nie calculer ces deux scores nommément cités comme des règles explicites. Il ne nie pas que les statistiques de choix des mots comptent.
L’effet concret est moindre qu’il n’y paraît. Varier le rythme de ses phrases reste utile, mais pour la raison donnée dans la section précédente, pas parce que vous actionneriez un curseur de burstiness. Nous avons retracé l’origine de cette histoire dans ce que mesurent les détecteurs d’IA au-delà de la perplexité et de la burstiness.
Correction 1 : reconstruire le paragraphe plutôt que réparer la phrase
Ouvrez le paragraphe signalé, puis fermez le brouillon et réécrivez le paragraphe à partir de vos notes, de votre plan ou de la source dont il est tiré. Ne retravaillez pas les phrases existantes. Rédigez le passage, puis comparez-le à l’ancien pour vérifier qu’aucun fait, aucun chiffre ni aucune citation n’a disparu.
Pourquoi commencer par là : comme le score est attribué par segment, les phrases environnantes font partie de ce qui a produit le score. Un paragraphe réécrit à partir des sources se retrouve avec un autre inventaire de phrases, un autre ordre dans les affirmations et, en général, une autre longueur. Un paragraphe corrigé mot à mot garde la même forme.
Procédez par séries de deux ou trois paragraphes consécutifs plutôt qu’en dispersant des corrections d’une phrase dans tout le document. Les segments chevauchent les frontières des paragraphes : un travail continu accomplit donc plus que le même nombre de retouches saupoudrées çà et là.
C’est la correction la plus lente. C’est aussi la seule qui produise de façon fiable un texte que vous pouvez défendre comme le vôtre, phrase par phrase, si quelqu’un vous le demande.
Correction 2 : réintroduire de la variation structurelle
Premier point de la liste des faux positifs de Turnitin. Les brouillons générés — et, honnêtement, beaucoup de brouillons humains écrits à bout de forces — convergent vers la même forme : des paragraphes de longueur quasiment identique, chacun ouvert par une phrase d’annonce du sujet, chacun fermé par une conclusion du type « cela montre que », chacun contenant trois arguments d’appui.
Ce qu’il faut changer :
- Laissez la longueur du paragraphe suivre le travail qu’il fait. Une réserve peut tenir en une seule phrase. Un exemple développé peut en faire douze, et il le faut, si c’est le prix pour traiter l’exemple à fond.
- Supprimez la phrase de synthèse finale dans les paragraphes qui n’en ont pas besoin. Dans bien des brouillons, un paragraphe sur trois finit par reformuler sa propre ouverture.
- Rompez le réflexe de la phrase d’ouverture-thème : commencez un paragraphe par l’exception, un autre par le chiffre, un autre en plein milieu du raisonnement.
- Certaines phrases devraient simplement s’arrêter.
Un piège. Transformer la prose en liste à puces n’est pas cette correction. Les puces ne sont pas du texte éligible : sortir la prose des phrases, c’est la sortir de l’analyse, ce qui peut faire bouger le chiffre sans que rien dans votre écriture n’ait changé. Votre correcteur le remarquera, et vous aurez abîmé le devoir pour arranger une statistique. Déplacer le texte dans un tableau ne fait même pas autant : une note de version indique que Turnitin peut désormais traiter la prose longue dans les tableaux, et que les dépôts déjà effectués doivent être soumis à nouveau pour que cela s’applique à eux.
Correction 3 : supprimer tout ce que votre brouillon dit deux fois
Deuxième point de la liste, et le gain le moins coûteux de cette page.
Cherchez dans votre propre document les suites de six mots ou plus qui se répètent. Vérifiez ensuite les quatre endroits où les brouillons académiques se répètent par habitude : le résumé face à l’introduction, l’introduction face à la première section, chaque « comme mentionné plus haut », et la conclusion face à tout le reste. Cherchez aussi le paragraphe qui reformule sa propre phrase d’ouverture à la fin : c’est le problème de la correction 2 avec un autre chapeau.
Supprimez la deuxième occurrence, pas la première. Si un point doit vraiment être repris en conclusion, reprenez-le en une proposition, pas en un paragraphe.
Bien mené, ce travail peut retirer à une section une quantité de texte étonnante. Il raccourcit aussi le devoir, ce qui est généralement un problème distinct que vous avez déjà.
Correction 4 : développer l’idée au lieu de la reformuler
Troisième point : « text that has been paraphrased without developing new ideas » (un texte paraphrasé sans développer d’idées nouvelles). C’est la seule correction de la liste qui modifie ce que le paragraphe affirme plutôt que la façon dont il se lit, et c’est celle qui résiste au contact d’un correcteur réel.
Pour chaque passage signalé, ajoutez ce que vous seul pouvez ajouter :
- Le chiffre tiré de vos propres données, et le seul cas où il ne se vérifie pas.
- Pourquoi vous avez retenu cette méthode après avoir écarté celle qui allait de soi.
- Une limite que vous avez remarquée en menant le travail, plutôt qu’une limite trouvée dans la section discussion de quelqu’un d’autre.
- L’endroit où deux de vos sources se contredisent, et celle que vous suivez.
- Le résultat que vous attendiez et que vous n’avez pas obtenu.
Si un paragraphe ne peut rien absorber de tout cela, demandez-vous s’il porte seulement une argumentation. Les paragraphes vrais mais vides sont ceux qui se lisent comme générés et, de l’aveu même de Turnitin, ce sont aussi ceux que son détecteur ne traite pas correctement.
Coût : celui-ci est sans limite. Cela peut signifier retourner à vos sources pendant un après-midi. C’est aussi la seule correction de cette page qui améliore la note indépendamment de tout score de détection.
Correction 5 : vérifier si votre document est seulement assez long pour que cela fonctionne
Turnitin indique que les documents courts se comportent autrement :
"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents courts, qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », car nous prédisons sur un seul segment, sans possibilité de chevauchement.)
Et la phrase suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant du contenu généré par IA et du contenu original pourrait être signalé comme entièrement généré par IA.)
Pour une déclaration personnelle de 500 mots ou un message de discussion, il n’y a concrètement qu’un seul segment. Corriger deux phrases à l’intérieur ne constitue pas un progrès partiel vers quoi que ce soit. Soit vous réécrivez entièrement le texte à partir de vos notes, soit vous acceptez que le score se comporte comme documenté et vous consacrez votre énergie à pouvoir montrer comment vous l’avez écrit. Nous avons traité ce versant dans signalé, alors que vous l’avez écrit vous-même.
Ce que vise chaque correction, et son coût approximatif
La colonne « effort » est une estimation, pas une mesure. Elle suppose une prose académique en anglais, vos notes à portée de main et aucune interruption : un ensemble d’hypothèses qui ne s’est jamais vérifié une seule fois.
| Correction | Ce qu’elle vise | Effort approximatif pour 1 000 mots |
|---|---|---|
| Reconstruire les paragraphes à partir de vos notes | Score attribué au segment : l’unité est le passage, pas la phrase | 45 à 90 min |
| Rétablir la variation structurelle | "content without a lot of structural variation" (un contenu sans grande variation structurelle) | 15 à 30 min |
| Supprimer les répétitions littérales | "text that literally repeats itself" (un texte qui se répète littéralement) | 10 à 20 min |
| Développer les idées, ajouter ce que vous seul savez | "paraphrased without developing new ideas" (paraphrasé sans développer d’idées nouvelles) | Sans limite, souvent des heures |
| Convertir la prose en puces | Retire la prose de l’analyse au lieu de la modifier | Ne le faites pas |
Lisez les quatre premières lignes comme une seule tâche, pas comme un menu. Elles se recouvrent largement : reconstruire un paragraphe à partir de ses notes corrige en général sa longueur, ses répétitions et son vide en une seule passe.
Vous ne pouvez probablement rien mesurer de tout cela
C’est la partie que la plupart des guides passent sous silence, et elle change ce que vous devriez faire.
L’indicateur et le rapport d’écriture IA ne sont pas visibles pour les étudiants. Seuls les enseignants et les administrateurs les voient, même si un enseignant peut télécharger le rapport au format PDF et le partager. Donc, à moins que quelqu’un ne vous le montre, vous corrigez sans aucun instrument de mesure.
Même avec le rapport sous les yeux, la résolution est mauvaise dans le bas de l’échelle. Turnitin n’affiche pas de pourcentage pour les scores compris entre 1 et 19 : il affiche un astérisque, et explique le faire pour éviter d’éventuels faux positifs. Une correction qui a fait passer un document de 18 % à 6 % apparaît donc sur le rapport exactement comme une correction qui n’a rien changé.
Le modèle est aussi conçu pour sous-déclarer. Turnitin indique que, pour maintenir son taux de faux positifs à un niveau bas, « there is a chance that we might miss some AI written text in a document » (il est possible que nous passions à côté d’une partie du texte écrit par IA dans un document), et donne son propre exemple : un document annoncé à 50 % « could contain as much as 65% AI writing » (pourrait contenir jusqu’à 65 % d’écriture IA). Un chiffre qui baisse ne prouve pas grand-chose, dans un sens comme dans l’autre.
Une chose à garder en tête pendant ce travail. Selon les recommandations de Turnitin aux enseignants, le score est utilisé conformément à son objet lorsqu’il est traité comme « a single data point rather than a definitive response » (une donnée parmi d’autres plutôt qu’une réponse définitive), et trois de ses pages d’aide indiquent que le score ne doit pas être le seul fondement d’une mesure défavorable à un étudiant. Corrigez le devoir. Le score vient après le devoir, et de toute façon vous ne le voyez pas.
Ce que ce travail à la main coûte réellement
Le temps est le coût évident, et il ne croît pas de façon linéaire. Un essai de 1 500 mots, c’est une soirée. Un chapitre de 8 000 mots avec tableaux, bibliographie et renvois est une tout autre affaire, car la correction n’est plus la partie difficile.
Les coûts moins évidents :
- Chaque paragraphe réécrit est un paragraphe à vérifier à nouveau. Les chiffres, le temps des verbes dans la section méthodes, le fait que la citation renvoie toujours à l’affirmation à laquelle elle était attachée. La vérification prend souvent plus de temps que la réécriture.
- Vous pouvez aplatir votre propre argumentation. Trois passes de « rends ça moins uniforme » sur votre prose, à 1 h du matin, et une précaution prudente se transforme en affirmation excessive.
- Sur les fichiers longs, les dégâts sont structurels. Renvois, légendes numérotées, notes de bas de page et champs de table des matières se cassent quand le texte bouge, et ils se cassent en silence. Nous avons décrit ce mode de défaillance dans champs Word, tables des matières et renvois.
- Vous risquez de refaire un travail qui était déjà bon, parce que vous ne pouvez pas savoir quels passages ont été signalés, à moins que votre enseignant ne partage le rapport.
Le périmètre, c’est la partie coûteuse, et c’est aussi celle autour de laquelle HumanPen a été conçu : lisez donc ce paragraphe comme les propos d’une partie prenante. La fonction d’import du rapport prend le AI Writing Report qu’on vous a remis et, selon les termes de cette page, « Only passages matched from the report are rewritten; the rest of the document is preserved verbatim » (Seuls les passages correspondants du rapport sont réécrits ; le reste du document est préservé à l’identique). Les passages éligibles peuvent être relancés gratuitement. Faites les corrections à la main ou pas. Le principe est le même dans les deux cas, et il est ennuyeux : plus le périmètre est étroit, moins il y a à revérifier ensuite.
Quand le faire à la main, malgré tout
La correction manuelle est le bon choix plus souvent qu’un vendeur d’outils ne voudrait l’admettre :
- Le document est court. Sur quelques centaines de mots, de toute façon vous réécrivez tout.
- Vos notes et vos sources sont encore ouvertes. La correction 4 est alors presque gratuite, et impossible six mois plus tard.
- La section signalée est de celles que vous pouvez réellement réécrire à partir du travail de fond, comme une section méthodes ou un paragraphe de résultats.
- Le problème repéré par le rapport est un vrai problème. Répétitions, paragraphes vides et structure uniforme sont d’abord des défauts d’écriture. Les corriger améliore le devoir, que le chiffre bouge ou non.
Questions fréquentes
Faire varier la longueur des phrases fait-il baisser un score de détection d’IA ? Pas pour la raison habituellement avancée. Turnitin indique que son modèle n’est pas explicitement programmé pour évaluer des signaux tels que la burstiness ou la perplexité. Mais il cite séparément « content without a lot of structural variation » (un contenu sans grande variation structurelle) comme une propriété fréquente dans ses propres faux positifs : la variation mérite donc d’être rétablie. Considérez-la comme une correction parmi d’autres, pas comme l’astuce.
Combien dois-je changer avant que le chiffre bouge ? Personne ne peut vous le dire, et quiconque vous donne un pourcentage l’invente. Turnitin attribue un score à des segments qui se chevauchent, puis regroupe les résultats : l’effet d’une correction dépend donc du passage qui l’entoure. Vous perdez aussi tout retour d’information dans la plage de 1 % à 19 %, où le rapport affiche un astérisque à la place d’un chiffre.
Ma bibliographie a été surlignée. Dois-je modifier mes références ? Vérifiez d’abord quel rapport vous avez entre les mains. Une note de version indique que les bibliographies sont exclues lors du traitement du rapport d’écriture IA (les dépôts déjà effectués ne bénéficient de ce changement qu’après une nouvelle soumission), et Turnitin indique que les surlignages d’écriture IA ne sont pas visibles du tout dans le Similarity Report. Une bibliographie surlignée est presque toujours une correspondance de similarité, et des entrées de référence qui se correspondent sont le cas ordinaire : un style citationnel existe précisément pour que chacun mette la même source en forme de la même façon.
Je n’ai utilisé qu’un correcteur grammatical. Est-ce que cela est signalé ? La FAQ de Turnitin indique que, lors de tests menés sur des documents écrits par des humains, "in most cases" (dans la plupart des cas) les modifications apportées par Grammarly et d’autres correcteurs grammaticaux n’ont pas été signalées par son détecteur. Elle précise ensuite que cela exclut les fonctions génératives de Grammarly — génération de brouillon, paraphrase et résumé — et que le contenu produit avec ces fonctions "will likely be flagged as AI-generated by our detector" (sera probablement signalé comme généré par IA par notre détecteur). La ligne de partage qu’elle trace se situe entre corriger vos phrases et les générer.
Existe-t-il un score à viser ? Il n’existe aucun seuil publié, et chaque établissement définit sa propre pratique. Selon les recommandations de Turnitin aux enseignants, le score est utilisé conformément à son objet lorsqu’il est traité comme « a single data point rather than a definitive response » (une donnée parmi d’autres plutôt qu’une réponse définitive). Nous avons expliqué pourquoi le chiffre populaire de 20 % n’est pas une règle dans 20 % d’IA, est-ce trop ?.
Sources : les AI writing detection capabilities FAQs de Turnitin, Using the AI Writing Report et les AI writing detection model release notes. Citations vérifiées sur ces pages le 14 août 2026. Publié sur le blog d’une entreprise qui vend un outil d’humanisation de documents, ce qu’il est bon de savoir en lisant la section sur le coût de la correction manuelle.
CONTINUER LA LECTURE