Turnitin lit-il le texte des tableaux ? La règle de la prose dans les tableaux

Le texte des tableaux était autrefois invisible pour le détecteur d’IA de Turnitin. Cela a changé. Nous détaillons ce qui est désormais analysé, ce qui reste exclu, et pourquoi le pourcentage et les surlignages se contredisent si souvent.

L'équipe HumanPen

· 5 min de lecture

La confusion autour des tableaux

Si vous avez déjà rendu un devoir contenant des tableaux de données puis scruté le rapport d’écriture IA, vous vous êtes sans doute demandé ce que Turnitin avait réellement analysé. La confusion est compréhensible. Pendant longtemps, un article d’aide de Turnitin disait : « The model does not reliably detect AI-generated text in the form of non-prose, such as poetry, scripts, or code, nor does it detect short-form/unconventional writing such as bullet points, tables, or annotated bibliographies. » (Le modèle ne détecte pas de manière fiable le texte généré par IA sous une forme non narrative, comme la poésie, les scripts ou le code, et ne détecte pas non plus les écrits courts ou non conventionnels tels que les puces, les tableaux ou les bibliographies annotées.)

Cette formulation rangeait les tableaux dans la même catégorie que la poésie et les scripts, des formats que le détecteur n’effleurait même pas. Étudiants et enseignants en ont déduit que tout texte placé dans un tableau était totalement ignoré. C’était une lecture raisonnable, mais ce n’était pas toute l’histoire.

En réalité, la détection d’IA de Turnitin ne traite que ce qu’elle appelle des phrases de prose. La documentation l’explique : « This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte éligible ne comprend que des phrases de prose : nous n’analysons que des blocs de texte rédigés en phrases grammaticales standard, à l’exclusion des autres formes d’écriture comme les listes, les puces (structures courtes qui ne sont pas des phrases) ou d’autres structures non phrasées.) Les tableaux n’ont pas été exclus par une règle propre aux tableaux : ils l’ont été parce que la plupart du contenu d’un tableau n’est pas de la prose.

Ce que Turnitin peut analyser dans un tableau

Turnitin a modifié sa logique de traitement. L’entrée datée du 9 août 2023 de sa page modèle de détection de l’écriture IA (guides.turnitin.com/hc/en-us/articles/28294949544717-AI-writing-detection-model) indique : « We are now able to process long-form prose text in tables. » (Nous sommes désormais en mesure de traiter la prose longue dans les tableaux.) Le changement est important. Si votre tableau contient des phrases complètes, grammaticalement standard, ces phrases sont maintenant analysées par le modèle de détection d’IA.

L’expression clé est « prose longue ». Une cellule qui dit « Les résultats indiquent une corrélation statistiquement significative entre la variable X et la variable Y, avec une valeur p inférieure à 0.01 » est une phrase de prose ordinaire, et elle sera traitée. Une cellule qui dit « p < 0.01 » ou « Variable X, 0.85 » n’est pas une phrase : c’est un fragment de donnée, et il sera ignoré.

La distinction compte, car beaucoup de tableaux académiques mêlent phrases complètes et courtes entrées de données. Les parties rédigées en phrases seront analysées, les données ne le seront pas. Vous ne pouvez pas considérer qu’un tableau entier est inclus ou exclu : Turnitin évalue le contenu bloc par bloc, à la recherche de phrases grammaticales standard, peu importe qu’elles se trouvent dans une cellule ou dans le corps du texte.

Cette même entrée donne aussi cette consigne : « Resubmit to reprocess existing submissions that contain tables. » (Renvoyez le travail pour retraiter les soumissions existantes qui contiennent des tableaux.) Si vous avez rendu un devoir avant cette mise à jour, la prose des tableaux n’a pas été traitée. Un nouvel envoi déclenche la logique mise à jour.

Ce qui reste exclu

Même après la mise à jour sur la prose des tableaux, plusieurs types de contenu échappent encore à l’analyse de détection d’IA. La règle « prose uniquement » signifie que les puces, les structures courtes non phrasées et les listes ne sont pas traitées. Si votre tableau contient de courts fragments plutôt que des phrases complètes, ces fragments sont exclus.

Les bibliographies ont été corrigées à la même date. L’entrée du 9 août 2023 indique : « We have fixed a bug that was occasionally highlighting AI writing within references listed in a bibliography. Bibliographies are now excluded when processing the AI writing report. » (Nous avons corrigé un bug qui surlignait parfois de l’écriture IA dans les références d’une bibliographie. Les bibliographies sont désormais exclues lors du traitement du rapport d’écriture IA.) Cette correction visait un problème précis : des entrées de référence étaient signalées, ce qui produisait des résultats trompeurs. La consigne est claire : « Resubmit to reprocess existing submissions that contain highlighted reference sections. » (Renvoyez le travail pour retraiter les soumissions existantes qui contiennent des sections de références surlignées.)

La liste des exclus comprend donc les fragments courts de tableau, les puces, les entrées de données et, désormais, les bibliographies dans leur intégralité. Le détecteur se concentre sur les phrases de prose du corps du texte et des cellules, et laisse tout le reste de côté. Ce n’est pas une faille du système, c’est un choix de conception lié au fait que le modèle a été entraîné sur de la prose, et non sur des formats de données ou des structures de citation.

Pourquoi votre pourcentage et vos surlignages ne concordent pas

L’une des sources de confusion les plus fréquentes est l’écart entre le pourcentage d’écriture IA et le texte surligné dans le rapport. La documentation l’aborde directement : « This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. » (Cela signifie qu’un document contenant plusieurs types d’écriture différents entraînerait un écart entre le pourcentage et les surlignages.)

Si votre document contient des tableaux avec des phrases complètes, de courts fragments de données, des puces et une bibliographie, seules les phrases de prose sont analysées. Le pourcentage reflète la part de la prose analysée que le modèle a classée comme générée par IA ; il ne reflète pas la part de l’ensemble du travail. La documentation précise : « This percentage is not necessarily the percentage of the entire submission. » (Ce pourcentage n’est pas nécessairement celui de l’ensemble du travail rendu.)

C’est pourquoi vous pouvez voir un score d’écriture IA de 40 % et seulement quelques paragraphes surlignés. Les surlignages montrent quels segments de prose ont été signalés. Le pourcentage est calculé à partir de la seule prose analysée. Le contenu exclu, comme les données de tableau ou les entrées de bibliographie, n’apparaît pas dans les surlignages et n’entre pas dans le calcul du pourcentage comme vous pourriez l’imaginer.

Comprendre cette distinction vous aide à lire correctement le rapport. Le pourcentage n’est pas un simple rapport entre texte signalé et texte total : c’est un score calculé sur la prose que le modèle a effectivement traitée, laquelle peut n’être qu’un sous-ensemble de votre document.

Ce qu’il faut vérifier avant de rendre

Avant de soumettre un document contenant des tableaux, nous vous conseillons d’en relire le contenu. Si vos cellules contiennent des phrases complètes, le détecteur d’IA les analysera. Assurez-vous que ces phrases reflètent votre propre écriture. Si vous avez utilisé l’IA pour rédiger de la prose dans un tableau, cette prose sera évaluée comme n’importe quelle autre phrase de votre travail.

Vérifiez votre bibliographie. Les bibliographies sont désormais exclues de l’analyse d’écriture IA : les références ne devraient donc pas apparaître comme texte surligné. Si vous avez un ancien rapport où des références étaient signalées, renvoyer le document appliquera la logique mise à jour qui exclut les bibliographies.

Si votre document mêle plusieurs types de contenu, ne soyez pas surpris si le pourcentage et les sections surlignées semblent incohérents. Comme l’explique la documentation, un écart entre le pourcentage et les surlignages est normal lorsqu’un document contient plusieurs types d’écriture. Lisez les surlignages pour comprendre quels segments précis de prose ont été signalés, et considérez le pourcentage comme un score tiré de la prose analysée, et non de l’ensemble du travail rendu.

Si vous avez déjà un rapport Turnitin sur l’écriture IA et que vous voulez retravailler les passages qui y sont signalés, vous pouvez importer ce rapport et ne réécrire que ces passages-là. Le rapport doit provenir du compte Turnitin de votre établissement ; nous n’en produisons pas nous-mêmes.

CONTINUER LA LECTURE