Turnitin peut-il analyser une thèse entière ?

Deux pages de Turnitin fixent un plafond de mots pour le rapport d'écriture IA. Une thèse se situe généralement au-dessus. Cela change ce que signifie un score, ce que signifie un indicateur vide, et le fichier que votre directeur avait réellement sous les yeux.

L'équipe HumanPen

· 7 min de lecture

La réponse courte

Turnitin ne génère pas de rapport d'écriture IA pour un dépôt de plus de 30 000 mots, ni pour un dépôt comptant moins de 300 mots de prose. Deux de ses propres pages d'aide indiquent les mêmes limites. En dehors de cette plage, il n'y a pas de pourcentage : l'indicateur affiche un double tiret gris, ce qui signifie que le dépôt n'a pas pu être traité, et non qu'il est revenu propre.

Une thèse complète dépasse normalement largement le plafond. Donc, si vous raisonnez à propos de votre « score IA de thèse », la première question est de savoir quel fichier l'a produit.

Les deux pages qui le disent

La première est une page courte intitulée Exigences relatives aux fichiers pour un AI Writing Report. La page entière fait environ 700 caractères. Elle commence par « In order for a submission to generate an AI writing report and percentage, the submission needs to meet the following requirements » (Pour qu'un dépôt génère un rapport d'écriture IA et un pourcentage, le dépôt doit satisfaire aux exigences suivantes), puis les énumère. Trois d'entre elles décident si un long document est seulement noté :

  • La taille du fichier doit être inférieure à 100 Mo
  • Le fichier doit comporter au moins 300 mots de texte en prose dans un format d'écriture long
  • Le fichier ne doit pas dépasser 30 000 mots

Le reste de la liste couvre les langues prises en charge et les types de fichiers acceptés.

La deuxième page est la FAQ sur les capacités de détection de l'écriture IA, qui reprend les mêmes exigences dans son explication de la signification des indicateurs du rapport. Mêmes chiffres, même ordre.

Que cela figure deux fois sur le propre site du fournisseur compte plus qu'il n'y paraît, car l'essentiel de ce qui circule sur les limites de Turnitin, c'est un blog qui recopie un autre blog.

Le double tiret gris n'est pas une réussite

La FAQ décrit ce que l'indicateur peut afficher. Un indicateur bleu avec un nombre compris entre 0 et 100 signifie que le dépôt a été traité. Un astérisque signifie que de l'IA a été détectée dans la plage de 1 % à 19 %, plage que Turnitin affiche sans nombre ni surlignage, afin d'éviter les faux positifs. Et ensuite :

« Gray with no percentage displayed (- -): The AI writing detection indicator is unable to process this submission. » (Gris, sans pourcentage affiché (- -) : l'indicateur de détection de l'écriture IA est incapable de traiter ce dépôt.)

La page donne les raisons. L'une : le dépôt est antérieur à la sortie de la détection de l'écriture IA, ce qui ne peut être corrigé qu'en déposant à nouveau. L'autre : le fichier ne satisfait pas aux exigences ci-dessus.

Un état d'erreur distinct, signalé par un point d'exclamation, signifie que Turnitin n'a pas réussi à traiter le dépôt et vous invite à réessayer ou à contacter le support.

Le tiret gris sur une thèse de 60 000 mots est donc le résultat attendu, et il ne dit rien de votre écriture. Mieux vaut savoir lequel des trois états vous avez sous les yeux avant de tirer la moindre conclusion, surtout si ce qui vous est parvenu est une capture d'écran.

Ce qui signifie qu'une thèse est notée chapitre par chapitre

En pratique, un long travail se dépose par morceaux : un chapitre au directeur, une section au comité de suivi, le fichier final dans le dépôt institutionnel. Chacun correspond à une prédiction distincte, et c'est là que l'arithmétique cesse d'être intuitive.

Turnitin décrit le mécanisme ainsi : découper le dépôt en segments chevauchants, noter chaque segment entre 0 et 1, laisser chaque phrase éligible hériter du score des segments qui la contiennent, puis regrouper et agréger le tout pour obtenir le chiffre du document. Les scores par chapitre ne sont pas des tranches d'un score de thèse, car ce score de thèse n'existe pas. Ce sont des exécutions distinctes portant sur des quantités de texte différentes.

À l'autre bout de la plage, le comportement est encore différent. Turnitin indique que, dans les documents de quelques centaines de mots seulement, la prédiction est surtout « all or nothing » (tout ou rien), parce qu'il n'y a qu'un seul segment et aucun chevauchement sur lequel moyenner ; et cela signifie, dit-il, qu'un contenu mêlé dans un court document peut être signalé comme entièrement généré par IA. Une introduction de 400 mots déposée seule se trouve exactement dans cette zone. Un résumé déposé seul n'atteint même pas le plancher de 300 mots de prose.

À l'autre extrémité, la FAQ est franche au sujet des longs documents : dans un document plus long mêlant écriture authentique et écriture générée par IA, il peut être difficile, dit-elle, de déterminer exactement où l'une finit et où l'autre commence ; elle décrit le résultat comme un guide pour engager la conversation avec l'étudiant.

Le pourcentage n'est pas un pourcentage de votre thèse

Même à l'intérieur de la plage, le chiffre couvre moins qu'on ne le pense. Turnitin analyse ce qu'il appelle le texte éligible, défini comme des phrases de prose : des blocs rédigés en phrases grammaticalement standard. Les listes, les puces et les autres structures qui ne sont pas des phrases en sont exclues. La FAQ affirme ensuite clairement que le pourcentage n'est pas nécessairement celui de l'ensemble du dépôt, et que le texte non considéré comme une prose longue n'est pas inclus.

Sa définition de la prose longue nomme directement le format : des phrases isolées contenues dans des paragraphes qui composent un écrit plus long, comme une dissertation, une thèse ou un article.

Imaginez maintenant un chapitre de méthodologie. Étapes de procédure numérotées, tableau de paramètres, équations, code, légendes de figures. Très peu de tout cela est fait de paragraphes de phrases. Le dénominateur du pourcentage se réduit aux parties de votre texte qui ont la forme d'une discussion ; et c'est aussi de là que vient le score. Comment lire un rapport d'écriture IA Turnitin détaille l'écart entre le chiffre et le surlignage.

Les 30 000 mots de qui ?

Turnitin ne publie pas le compteur qu'il utilise, et ce n'est pas une subtilité gratuite, car deux outils qui comptent le même fichier sont régulièrement en désaccord.

Les tirets sont les coupables habituels. Word traite un tiret entre deux mots comme une frontière de mot dans certaines formes et pas dans d'autres, ce qui est démontré clairement sur un blog de rédaction juridique d'UT Austin à l'aide d'une plage de pages ; et nous avons vu nos propres compteurs se mettre en désaccord avec Word sur des documents qui en sont remplis.

La marge est faible. Elle ne compte qu'à un seul endroit, et c'est celui-ci : si Word annonce 29 800 et que ce qui compte de l'autre côté annonce un chiffre légèrement supérieur, la différence entre un rapport et un tiret gris tient à une poignée de tirets. Près du plafond, divisez le fichier plutôt que de le découvrir après coup.

Que faire de tout cela

  1. Demandez quel fichier a été déposé avant d'interpréter le moindre score. Un chapitre, une thèse compilée, un PDF généré par le portail et une version sans annexes sont quatre dépôts différents.
  2. Traitez un tiret gris comme « non traité ». Ne le remontez pas comme un résultat propre.
  3. N'additionnez pas les pourcentages des chapitres, n'en faites pas la moyenne. Ce sont des prédictions distinctes sur des dénominateurs différents.
  4. Attendez-vous à ce que les sections courtes se comportent mal. L'explication donnée par Turnitin lui-même sur la notation tout ou rien des textes courts en est la raison, pas votre écriture.
  5. Rappelez-vous à quoi le fournisseur dit que sert ce chiffre. Turnitin affirme sur plusieurs de ses propres pages que le modèle peut se tromper et qu'il ne doit pas être le seul fondement d'une mesure défavorable à un étudiant ; ailleurs, il qualifie le score de simple donnée plutôt que de réponse définitive. C'est une phrase légitime à apporter à une réunion d'encadrement.

Si vous êtes déjà dans cette conversation et que vous avez écrit le texte vous-même, signalé, mais vous l'avez écrit vous-même traite des preuves qu'il vaut la peine de réunir.

S'il vous faut finalement réécrire un chapitre

Deux choses coûtent cher à l'échelle d'un chapitre : ce que vous devez relire ensuite, et ce que vous avez payé pour faire réécrire. Les deux dépendent du même réglage : la part du fichier entrée dans le périmètre. Trois paragraphes signalés et un chapitre entier représentent des quantités de relecture très différentes.

L'outil HumanPen fonctionne dans l'autre sens. Importez le rapport Turnitin ou iThenticate de ce chapitre, et ses passages signalés deviennent le périmètre : seul ce texte est réécrit, tout le reste est laissé tel quel, et la facturation compte les mots réellement réécrits, et non le document que vous avez téléversé. Le paragraphe est la plus petite unité touchée par le moteur, et une sélection n'en couvrant qu'une partie est étendue au paragraphe entier et vous est montrée avant le début du traitement. Il n'y a pas de plafond de mots par requête au téléversement, donc un chapitre entre comme un seul fichier. Les passages éligibles peuvent être relancés gratuitement.

Rien de tout cela n'est une prédiction sur votre prochain rapport. C'est une affirmation sur ce qui est touché et ce qui est facturé.

Questions fréquentes

Turnitin peut-il analyser un document de plus de 30 000 mots ? Pas pour l'écriture IA. La page des exigences relatives aux fichiers et la FAQ de Turnitin indiquent toutes deux qu'un dépôt ne doit pas dépasser 30 000 mots pour qu'un rapport d'écriture IA et un pourcentage soient générés. La vérification de similarité est un système distinct, avec son propre comportement.

Ma thèse est revenue sans pourcentage IA. Est-ce une bonne chose ? Il est très probable qu'aucun rapport n'ait été produit. Un double tiret gris signifie que l'indicateur n'a pas pu traiter le dépôt, et le dépassement des exigences relatives aux fichiers est l'une des raisons que Turnitin énumère.

Pourquoi le score de mon chapitre diffère-t-il de celui du fichier déposé par mon directeur ? Ce sont des exécutions différentes. Les scores sont calculés sur des segments chevauchants de ce qui a été déposé, et le pourcentage ne couvre que la prose éligible : deux fichiers contenant les mêmes mots peuvent donc produire des dénominateurs et des chiffres différents.

Y a-t-il une longueur minimale ? Oui. Le fichier doit comporter au moins 300 mots de texte en prose dans un format d'écriture long. Turnitin indique aussi que les prédictions sur des documents de quelques centaines de mots seulement tendent vers le tout ou rien, parce qu'il n'y a qu'un seul segment, sans chevauchement sur lequel moyenner.

CONTINUER LA LECTURE