Turnitin signale-t-il les travaux de réflexion comme générés par l’IA ? Les faux positifs expliqués
Un travail de réflexion se situe au croisement de la voix personnelle et d’une structure très standardisée. La documentation de Turnitin décrit elle-même les types de textes qui provoquent des faux positifs, et les travaux de réflexion correspondent à plusieurs de ces descriptions. Les travaux courts se heurtent en plus à une notation binaire, du tout ou rien. Voici ce que dit la documentation et ce que vous pouvez faire du score.
L'équipe HumanPen
· 5 min de lecture
Pourquoi les travaux de réflexion éveillent-ils les soupçons ?
Un travail de réflexion vous demande d’écrire sur votre propre expérience, mais la structure a tendance à se répéter. Vous présentez l’expérience, vous décrivez ce qui s’est passé, puis vous en tirez une leçon. Ce format introspectif fait que les phrases suivent souvent les mêmes schémas d’un étudiant à l’autre. La documentation de Turnitin décrit les types de textes qui produisent des faux positifs :
« Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas. » (Il arrive que des faux positifs — c’est-à-dire un texte écrit par un humain signalé à tort comme généré par l’IA — concernent un contenu qui manque de variation structurelle, un texte qui se répète littéralement, ou un texte reformulé sans apporter d’idées nouvelles.)
La phrase suivante : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur relève une part plus élevée d’écriture IA dans ce type de texte, nous vous conseillons d’en tenir compte lorsque vous examinez le pourcentage indiqué.)
Un travail de réflexion présente souvent ces trois caractéristiques à la fois. La variation structurelle est faible parce que le format introspectif suit une progression prévisible. Les formulations se répètent parce que les étudiants emploient le même vocabulaire pour parler de progression, de difficulté et d’apprentissage. Les idées sont reprises du contenu du cours et reformulées, sans que de nouveaux arguments soient véritablement développés. Rien de tout cela ne signifie que le texte a été généré par une IA. Cela signifie que le texte correspond au profil dont Turnitin dit lui-même qu’il peut produire des faux positifs — un profil bien plus facile à repérer une fois que l’on sait ce que mesurent les détecteurs d’IA.
Comment le détecteur traite votre texte
Pour comprendre pourquoi un travail de réflexion obtient un score élevé, il faut regarder comment le détecteur fonctionne :
« When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score. Since segments overlap, some sentences may have multiple scores, which are then pooled into a single score. These sentence scores are further aggregated and used to compute the overall document AI writing score. » (Lorsqu’un devoir est soumis à Turnitin, les phrases de la soumission sont extraites puis découpées en sections qui se chevauchent, en vue de l’analyse de prédiction. Chaque section est classée par le modèle de détection d’IA et reçoit une valeur comprise entre 0 et 1, qui indique la probabilité que le texte soit plutôt l’œuvre d’un humain ou généré par l’IA. Chaque phrase éligible à l’intérieur de ces sections hérite du score de sa section. Comme les sections se chevauchent, certaines phrases peuvent recevoir plusieurs scores, qui sont ensuite regroupés en un score unique. Ces scores de phrase sont à leur tour agrégés et servent à calculer le score global d’écriture IA du document.)
Chaque phrase reçoit un score de probabilité. Ces scores sont regroupés puis agrégés en un pourcentage unique à l’échelle du document. Un travail de réflexion dont les phrases se ressemblent d’un bout à l’autre peut recevoir des scores élevés dans toutes les sections, et ces scores se cumulent pour donner un pourcentage global élevé.
Ce que le détecteur analyse réellement
Le détecteur ne traite pas tous les mots de la soumission. Il ne traite que le texte éligible :
« The model does not reliably detect AI-generated text in the form of non-prose, or code, nor does it detect short-form/unconventional writing such as bullet points (short non-sentence structures). » (Le modèle ne détecte pas de façon fiable le texte généré par l’IA lorsqu’il se présente sous une forme non prose ou sous forme de code, et il ne détecte pas non plus les écritures courtes ou inhabituelles, comme les listes à puces, c’est-à-dire de courtes structures qui ne sont pas des phrases.)
La phrase suivante : « This means that a document containing several different writing types would result in a disparity between the percentage and the highlights. » (Cela signifie qu’un document contenant plusieurs types d’écriture différents peut donner lieu à un écart entre le pourcentage et les passages surlignés.)
La même documentation précise ce qui est pris en compte :
« This qualifying text includes only prose sentences, meaning that we only analyze blocks of text that are written in standard grammatical sentences and do not include other types of writing such as lists, bullet points (short non-sentence structures), or other non-sentence structures. » (Ce texte éligible ne comprend que des phrases de prose : nous n’analysons que les blocs de texte rédigés en phrases grammaticalement correctes, et nous n’incluons pas d’autres types d’écriture tels que les listes, les listes à puces, c’est-à-dire de courtes structures qui ne sont pas des phrases, ou d’autres structures qui ne sont pas des phrases.)
La phrase suivante : « This percentage is not necessarily the percentage of the entire submission. » (Ce pourcentage n’est pas nécessairement celui de l’ensemble de la soumission.)
Dans un travail de réflexion, l’essentiel du texte est constitué de phrases de prose : le texte éligible couvre donc la majeure partie du document. La question de l’écart se pose moins ici que dans les documents au format mixte. Le pourcentage que vous voyez est proche de celui de la prose réellement analysée.
Le problème des documents courts
Les travaux de réflexion sont souvent courts. Une réflexion de 500 mots est monnaie courante, et la documentation met en garde contre ce cas de figure précis :
« In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. » (Dans les documents courts qui ne comptent que quelques centaines de mots, la prédiction sera le plus souvent « tout ou rien », parce qu’elle porte sur une seule section, sans possibilité de chevauchement.)
La phrase suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant contenu généré par l’IA et contenu original peut être signalé comme entièrement généré par l’IA.)
Dans un travail de réflexion court, le détecteur peut n’avoir qu’une seule section à noter. Aucun chevauchement ne vient lisser la prédiction. Si cette unique section obtient un score élevé, c’est tout le devoir qui est signalé. Un document mixte, en partie original et en partie rédigé avec une aide à la rédaction, peut donc être signalé comme généré à 100 % par l’IA — l’une des voies qui mènent à pourquoi Turnitin annonce que votre travail est IA à 100 %. La brièveté supprime l’effet de moyenne dont profitent les documents plus longs.
Ne faites pas du score la seule preuve
La documentation de Turnitin est explicite sur la façon dont le score doit et ne doit pas être utilisé :
« Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student. » (Notre modèle de détection d’écriture IA n’est pas toujours exact — il peut se tromper sur un texte écrit par un humain, généré par l’IA ou reformulé par l’IA — et il ne doit donc pas servir de seul fondement à des mesures défavorables à l’encontre d’un étudiant.)
La phrase suivante : « It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred. » (Il faut un examen plus approfondi et un jugement humain, articulés avec l’application par l’établissement de ses propres politiques académiques, pour déterminer s’il y a eu inconduite académique.)
Une autre source Turnitin renforce cette position :
« It is not meant to provide definitive answers in isolation. More important than any tool is the educator who sees the score and makes decisions balancing this information with their personal knowledge of their students, their work, and institutional policy. » (Il n’est pas destiné à fournir à lui seul des réponses définitives. Plus important que n’importe quel outil, il y a l’enseignant qui voit le score et prend ses décisions en mettant cette information en balance avec la connaissance personnelle qu’il a de ses étudiants, de leur travail et de la politique de l’établissement.)
La phrase suivante : « When educators look at the AI writing score and utilize it as a single data point rather than a definitive response, then it is being used as intended. » (Lorsque les enseignants regardent le score d’écriture IA et l’utilisent comme un simple point de données plutôt que comme une réponse définitive, alors l’outil est utilisé comme prévu.)
Si votre travail de réflexion reçoit un score IA élevé, ce score n’est qu’un point de données. Ce n’est pas une preuve. La documentation indique que le modèle peut se tromper sur un texte, et elle demande qu’un jugement humain s’y ajoute, en lien avec la politique de l’établissement. Si c’est à vous de répondre de ce score, signalé, alors que vous l’avez écrit vous-même explique comment préparer cette réponse.
Ce que cela change pour vous
Pour résumer ce que nous avons vu :
- Les travaux de réflexion correspondent à plusieurs schémas de faux positifs décrits dans la documentation de Turnitin : faible variation structurelle, formulations répétitives et idées reformulées.
- Turnitin conseille : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur relève une part plus élevée d’écriture IA dans ce type de texte, nous vous conseillons d’en tenir compte lorsque vous examinez le pourcentage indiqué.)
- Le détecteur découpe le texte en sections et note chaque section. Un devoir court peut n’en comporter qu’une seule, ce qui donne un résultat en tout ou rien.
- Les travaux de réflexion courts (quelques centaines de mots) sont les plus exposés à un score binaire.
- Le score ne doit pas servir de seul fondement à des mesures défavorables. C’est un point de données unique, qui appelle un jugement humain.
Si vous recevez un rapport IA Turnitin sur un travail de réflexion et que vous souhaitez traiter les passages signalés, importez le rapport et travaillez dessus. Les passages éligibles peuvent être relancés gratuitement.
CONTINUER LA LECTURE