Turnitin peut-il détecter l’IA dans des copies qui ne sont pas en anglais ?

La question de la langue se divise en trois, qu’on traite comme si elles n’en faisaient qu’une — et c’est généralement la mauvaise qui reçoit une réponse en premier. Il y a la langue du fichier. Il y a ce que le détecteur prend en charge. Et il y a ce qui se passe lorsque vous avez écrit dans une langue et rendu le travail dans une autre : c’est de cette situation-là que parlent, en réalité, la plupart des gens qui posent la question.

L'équipe HumanPen

· 6 min de lecture

La réponse courte

Quatre, à la date du 18 août 2026. Ce jour-là, Turnitin a ajouté le Modern Standard Arabic à l’anglais, à l’espagnol et au japonais, et sa propre page sur les exigences relatives aux fichiers en annonce encore trois : vérifiez donc la date de tout ce que vous lisez à ce sujet, y compris ce texte. Un fichier rédigé dans une langue étrangère à ces quatre-là sort de ce que le AI Writing Report est documenté comme capable de traiter. Et la règle porte sur la langue du fichier que vous déposez : un travail rédigé en portugais et rendu en anglais est une copie en anglais.

La liste des langues prises en charge, textuellement

Tiré de la page de Turnitin exigences relatives aux fichiers pour un AI Writing Report, dans sa version du 21 août 2026 :

"File must be written in a supported language: English, Spanish, Japanese" (Le fichier doit être rédigé dans une langue prise en charge : l’anglais, l’espagnol, le japonais)

Tout juste à côté, dans la même courte liste : « Accepted file types: .docx, .pdf, .txt, .rtf » (Types de fichiers acceptés : .docx, .pdf, .txt, .rtf). Cette ligne-là est à jour. Celle sur les langues accuse trois jours de retard.

L’arabe est entré en service le 18 août 2026 et la page des exigences n’a pas été modifiée depuis. L’entrée des notes de version à cette date est intitulée « New AI detection writing detection capabilities for Modern Standard Arabic submissions » (Nouvelles capacités de détection de l’écriture par IA pour les copies en Modern Standard Arabic), et la page des mises à jour produit le résume en une phrase : « Arabic detection will run alongside our English, Spanish, and Japanese detectors » (La détection pour l’arabe fonctionnera parallèlement à nos détecteurs pour l’anglais, l’espagnol et le japonais). La liste opérationnelle est donc de quatre. Si vous ouvrez la page des exigences et n’en comptez que trois, vous êtes tombé sur une page qui n’a pas suivi, pas sur une contradiction. L’allemand, le chinois, le portugais et le coréen ne figurent dans aucune des deux versions.

Les quatre détecteurs ne sont pas identiques entre eux

C’est la partie qui arrive rarement jusqu’aux résumés. La page de FAQ consacrée à la détection de l’écriture par IA commence par se limiter elle-même : « The following content and FAQs pertain to our AI writing detection capabilities for English submissions only. » (Le contenu et les FAQ qui suivent concernent uniquement nos capacités de détection de l’écriture par IA pour les copies en anglais.) Juste sous cette ligne se trouvent trois liens sortants : l’un vers une FAQ en espagnol, l’autre vers une FAQ en japonais, le dernier vers une FAQ en arabe. La note de version dit pourquoi, en termes plus simples : « our Arabic AI writing model is a separate model from our English AI writing, Spanish AI writing, and Japanese AI writing models » (notre modèle d’écriture IA pour l’arabe est un modèle distinct de nos modèles d’écriture IA pour l’anglais, l’espagnol et le japonais).

Et la capacité qui recherche un texte passé par des outils de paraphrase ou de contournement n’existe qu’en anglais. La page de Turnitin sur l’utilisation du AI Writing Report indique : « only our English AI detector includes AI paraphrasing and AI bypasser detection capabilities » (seul notre détecteur IA pour l’anglais inclut des capacités de détection de la paraphrase par IA et du contournement par IA), et la phrase juste après : « At this time our Spanish and Japanese AI detectors do not include AI paraphrasing or AI bypasser detection capabilities. » (À l’heure actuelle, nos détecteurs IA pour l’espagnol et le japonais n’incluent pas de capacités de détection de la paraphrase par IA ni du contournement par IA.) Cette page n’a pas été révisée pour l’arabe et n’en cite toujours que deux. Le détecteur pour l’arabe ne passe pas à travers la brèche : la FAQ en arabe de Turnitin répond à la question sur sa propre page, en indiquant que la détection de la paraphrase par IA n’est actuellement disponible que dans le détecteur pour l’anglais. Cette page est en arabe ; la formulation anglaise donnée ici est la nôtre.

Ne lisez pas cela comme une ouverture. Lisez-le comme un rappel : « la détection de l’IA par Turnitin » n’est pas un bloc uniforme, et tout ce que vous avez lu sur son fonctionnement a presque certainement été écrit à propos du détecteur pour l’anglais.

Traduire en anglais, c’est en faire une copie en anglais

L’exigence porte sur le fichier. Si vous avez rédigé dans votre langue maternelle et que le document que vous déposez est en anglais, c’est le texte anglais qui est segmenté et noté, peu importe où les idées ont été couchées sur le papier pour la première fois.

Ce qui soulève la question que les gens posent réellement : une prose traduite automatiquement ressemble-t-elle à une sortie de modèle ? Turnitin n’a rien publié qui y réponde directement, et personne en dehors de Turnitin n’a l’accès nécessaire pour y répondre correctement. Ce que Turnitin a publié, c’est la liste des propriétés qui reviennent dans ses propres faux positifs :

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." (Il arrive que les faux positifs — c’est-à-dire le fait de signaler à tort un texte écrit par un humain comme généré par IA — portent sur un contenu qui manque de variation structurelle, sur un texte qui se répète littéralement, ou sur un texte paraphrasé sans développer d’idées nouvelles.)

Une prose académique traduite peut correspondre aux trois, non pas parce que son auteur aurait mal agi, mais parce que la traduction a tendance à normaliser la forme des phrases. Ce rapprochement est notre propre inférence, ce n’est pas une déclaration de Turnitin.

C’est la phrase suivante, signée Turnitin, qu’il faut emporter à une réunion avec son directeur : « If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated. » (Si notre indicateur montre une quantité plus élevée d’écriture par IA dans ce texte, nous vous conseillons d’en tenir compte lorsque vous examinez le pourcentage indiqué.) Le fournisseur a officiellement consigné le fait que les personnes qui lisent ces rapports doivent en tenir compte.

Ce que Turnitin dit avoir fait contre les biais

Sa FAQ indique que l’échantillon d’entraînement a délibérément inclus « statistically under-represented groups like second-language learners, English users from non-English speaking countries, students at colleges and universities with diverse enrollments and less common subject areas such as anthropology, geology, sociology, and others to minimize bias when training our model » (des groupes statistiquement sous-représentés, comme les apprenants de l’anglais comme langue seconde, les anglophones de pays non anglophones, les étudiants de colleges et d’universités à recrutement diversifié, ainsi que des domaines moins courants comme l’anthropologie, la géologie, la sociologie et d’autres) afin de réduire les biais lors de l’entraînement de notre modèle.

C’est la version de l’entreprise sur son propre processus, et elle n’est accompagnée d’aucun chiffre publié sur les biais. Considérez-la comme une intention déclarée. La question distincte de savoir qui est réellement signalé plus souvent a ses propres données, et nous les avons passées en revue dans pourquoi les anglophones non natifs sont plus souvent signalés.

Les documents courts se comportent plus mal, dans toutes les langues

Avant de tenir pour acquis qu’une réflexion de deux pages est le cas à faible risque :

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap." (Dans les documents plus courts, qui ne comptent que quelques centaines de mots, la prédiction sera la plupart du temps « tout ou rien », parce que nous prédisons sur un seul segment, sans possibilité de chevauchement.)

La ligne suivante : « This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated. » (Cela signifie qu’un texte mêlant contenu généré par IA et contenu original peut être signalé comme entièrement généré par IA.) Les textes courts sont le point de rencontre entre une écriture très marquée par la traduction et une notation en tout ou rien, et cette combinaison produit les rapports les plus difficiles à contester.

Foire aux questions

Mon travail est en allemand. Va-t-il recevoir un score d’IA ? L’allemand ne figure pas dans la liste des langues prises en charge par un AI Writing Report. Que la configuration de votre établissement fasse autre chose du fichier est une question à poser à l’établissement, cela ne relève pas de la documentation de Turnitin.

Je l’ai écrit moi-même, puis j’ai utilisé un outil de traduction. Est-ce généré par IA ? Ce sont deux questions différentes, et la première ne trouve de réponse que dans votre établissement. Les règles de divulgation couvrent de plus en plus la traduction autant que la rédaction : lisez donc la politique réelle plutôt que de supposer que la traduction est exemptée.

Le détecteur pour l’espagnol fonctionne-t-il comme celui pour l’anglais ? Pas de façon identique, et pas plus que celui pour le japonais ou pour l’arabe. Turnitin décrit les quatre comme des modèles distincts, la couche paraphrase et contournement est documentée comme réservée à l’anglais, et la FAQ principale se limite aux copies en anglais et renvoie les trois autres langues vers des pages qui leur sont propres.

Mon université utilise Turnitin, mais je n’ai jamais vu de pourcentage d’IA. C’est normal. Turnitin indique que seuls les enseignants et les administrateurs peuvent voir l’indicateur, même si les enseignants peuvent télécharger le rapport au format PDF et le partager. Et la détection de l’IA exige une licence spécifique, si bien que certains établissements n’en ont aucune.

Le modèle cherche-t-il à identifier quel outil d’IA a été utilisé ? Non. Il classe les segments selon la probabilité qu’ils soient plutôt humains ou plutôt générés par IA (plus d’explications sur ce que mesure cette grandeur).

CONTINUER LA LECTURE