Turnitin は Claude、Copilot、Gemini を検出できますか

あるアシスタントから別のアシスタントに乗り換えるとき、人は無意識のうちに「検出器はどのモデルがその文章を書いたのかを見分ける」と想定しています。Turnitin の FAQ、更新ページ、レポートのドキュメントは、対応範囲、リリース、出力をそれぞれ異なる粒度で説明しています。この粒度を分けて考えると、正直に言えることは変わってきます。

HumanPen チーム

· 10 分

短い答え

Claude と Gemini のバージョンは、Turnitin の英語検出器が「can detect content from」(そのコンテンツを検出できる)と述べるモデルの一覧に載っています。Copilot は私たちが読んだ5つのページでは名前が挙がっていません。しかしそれは、適用外という意味でも、ある特定の Copilot の提出物が検出されるという証拠でもありません。Product Updates や一般的なリリースノートも、言語別の更新の中でモデル名を挙げています。つまり FAQ は、Turnitin がモデル名を公開している唯一の場所というわけではありません。読んだ資料のどこにも、モデルごとの安定したオッズ表はありません。レポートのドキュメントが説明しているのは、重なり合うテキスト区間について計算される確率と、人間による可能性が高いか AI 生成の可能性が高いかに分類される出力です。

情報源は、2026年8月18日に読んだ、名前のはっきりしている5つのページです。AI Writing Report のガイド、検出に関する FAQ、AI 執筆検出モデルの変更履歴、Turnitin の一般的なリリースノート、そして Product Updates です。以下の結論は、それらのページと引用した節の範囲にとどまります。Turnitin のサイト全体を網羅するとは言っていませんし、その場で更新されるページの文字数や一致語数を本記事が公開することもありません。

この記事が主張していないことを一つ挙げます。モデルを乗り換えても何も変わらない、とは言っていません。読んだ情報源には、その比較を予測できる数字がありません。私たちにもありません。

FAQ の対応モデル一覧

その一覧は Turnitin の AI 執筆検出 FAQ にあり、同じページの中に2回現れます。1回は「How does it work?」(どのように機能しますか)という質問への回答の中、もう1回は「Which AI writing models can Turnitin's technology detect?」(Turnitin の技術はどの AI 執筆モデルを検出できますか)という質問の下です。どちらのコピーも同じ書き出しです。

「Currently, Turnitin's AI writing detection model for English submissions can detect content from GPT-4o (released 2024-05) ...」(現在、英語の提出物に対する Turnitin の AI 執筆検出モデルは、2024-05 にリリースされた GPT-4o などからのコンテンツを検出できます……)

この動詞は、もう一度見る価値があります。「Can detect content from」(そのコンテンツを検出できる)は、対応範囲についての記述です。かつてテストを通ったものについての注記ではありません。そしてこのテーマについて書かれたものの多くは、ひそかに後者の意味へと柔らげています。2026年8月18日の時点で、この文は GPT、Gemini、Claude の複数のバージョンを挙げており、そこに LLaMA、Mistral、Deepseek、Nova、Grok からの項目と o1-mini が加わっていました。これはその時点で存在していたモデルファミリーを日付付きで切り取ったものであり、恒久的な総数ではありません。

各項目には、括弧書きでリリース日が付いています。これは無視してください。同じページにある同じ一覧の2つのコピーは、少なくとも2つの日付について食い違っています。2026年8月18日に確認したときも、食い違ったままでした。つまり、どちらを読んでも、そのページ自身が「日付は管理されていない」と教えてくれているということです。

その文は「and tools based on these LLMs as well」(これらの LLM に基づくツールも同様に)で終わり、その次の文は、Turnitin が「continue to expand our detection capabilities to other models in the future」(今後も私たちの検出能力を他のモデルへと拡大していく)と述べています。

Copilot が挙がっていないことは、何を示し、何を示さないのか

人はモデル名ではなく製品名で検索することがほとんどです。上に挙げた5つのページの中に、Copilot 固有の対応範囲の記述、精度の数値、結果の予測は見当たりませんでした。これはそれらのページについての限定的な所見であり、Turnitin のすべてのページについての主張ではありません。

FAQ はモデル一覧を「and tools based on these LLMs as well」(これらの LLM に基づくツールも同様に)という語句で締めくくっています。この一般的な条項は、あるツールが一覧に載ったモデルを使っている場合には関係するかもしれません。しかし本記事では、特定の Copilot 製品、モード、日付がどのモデルを使っていたのかを特定できていません。その対応関係がなければ、この条項から「ある Copilot の提出物が判定されるかどうか」を読み取ることはできません。製品名がないことは、適用外も検出も証明しません。

対応一覧はモデルごとの序列ではない

英語版 FAQ は対応範囲の記述の中でモデル名を挙げていますが、その回答は各項目に検出率、精度の数値、難易度の序列を結びつけていません。検出について結びつけられている唯一の数値は、偽陽性についての全体的な目標です。「under 1% for documents with over 20% of AI writing」(AI 執筆が 20% を超える文書について 1% 未満)。この数値は検出器全体に当てはまるものであり、Claude と Gemini、あるいは他のどの組み合わせを比較するものでもありません。

Turnitin の他のページは、モデル名を確かに公開しています。Product Updates は、2026年5月5日のスペイン語モデルの更新で GPT と Gemini のバージョンを挙げました。Turnitin の一般的なリリースノートは、2026年8月18日にアラビア語モデルの更新を追加し、そこでは複数のモデルファミリーのバージョンが挙げられています。AI 執筆検出モデルの変更履歴は別のページとして、一部のリリースをより少ない詳細で要約しています。これらのページは、「FAQ だけが Turnitin がモデル名を挙げる公開された場所だ」という考えを直接的に否定しています。

それでも、名前が挙がっているこれらの更新が提供していないもの、それは任意の提出物についてのモデルごとの安定したオッズ表です。リリースの対応範囲についての記述と、ある1つのファイルについての予測は、別の主張です。

その数値は実際にはどこから来るのか

FAQ は処理の流れを1つの段落で説明しています。短いので、そのまま全部読めます。

「When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated. Each qualifying sentence within these segments inherits the segment's score.」(ある論文が Turnitin に提出されると、提出物から文が抽出され、予測分析のために重なり合う区間に分割されます。それぞれの区間は AI 検出モデルによって分類され、0 から 1 の値を与えられます。これは、そのテキストが人間による可能性が高いか、AI によって生成された可能性が高いかという確率を示すものです。これらの区間に含まれるそれぞれの対象文は、その区間のスコアを引き継ぎます。)

その最後の節にあるカテゴリーは2つです。人間による可能性が高い、AI 生成の可能性が高い。あるモデル固有の指紋を検出器が見分けるのだと誰かに言われたとしても、これがベンダー自身による、分類器の出力についての説明です。そこに3つ目の区分はありません。Turnitin はまた、自社のモデルが名前の付いた指標から組み立てられているわけではないとも述べています。「is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions」(公の議論で時に言及される 'burstiness,' や 'perplexity,'、あるいは他の個別の指標といった特定のシグナルを評価するよう、明示的にプログラムされているわけではありません)、そして「instead, it learns statistical patterns from our training data」(その代わりに、私たちの学習データから統計的なパターンを学びます)。この違いが実際に何を変えるのかは、AI 検出器は何を測定しているのかで順を追って説明しています。

もしあなたが、生成器ごとに1つずつ訓練された検出器の並びを思い浮かべていたなら、FAQ はモデル一覧のすぐ後の文で、逆向きの動きを説明しています。

「In July 2026, we updated our model architecture to consolidate a multi-model ensemble into a single model. This update improves and simplifies the AI writing report, maintaining a less than 1% false positive rate.」(2026年7月、私たちは複数モデルのアンサンブルを単一のモデルに統合するため、モデルアーキテクチャを更新しました。この更新は AI 執筆レポートを改善し、簡素化するものであり、偽陽性率は 1% 未満に保たれています。)

FAQ は、テキスト単位の確率を出力する1つの分類器を説明しています。それとは別に、モデルの対応範囲についての記述を公開しています。7月のアーキテクチャについての文は FAQ にはありますが、AI 執筆検出モデルの変更履歴にはありません。この食い違いが示しているのは、どの更新ページも一つの網羅的なリリース履歴として扱うのではなく、ページの種類を名指しする必要があるということです。

ベンダーは、多くの人が「どのツールか」の手がかりとして読んでいた区分を削除した

2026年8月4日、Turnitin はレポートの2つのカテゴリーを1つに統合しました。AI 生成テキストのうち AI によって言い換えられたものを示していた紫色のハイライトは、表示されなくなりました。同社が製品更新のページで示した理由は、ツールの特定について同社が公表した中で最も直接的なものであり、自社の利用者について述べたものです。

「Reduce the risk of unwarranted academic misconduct reviews by removing distinctions that could be read to imply more certainty about the specific tool or workflow used to produce a submission」(提出物の作成に使われた特定のツールや作業手順について、より確からしさを含意すると読まれかねない区分を取り除くことで、根拠のない学術不正の審査に巻き込まれるリスクを下げる)

ベンダーが2024年に追加した区分は、読み手が「そのレポートには載せられないはずのツールの正体」をそこから引き出していたため、2026年に姿を消しました。変わらなかったことにも注意してください。統合を告知するリリースノートは、モデルが「will continue to detect likely AI generated content that may have been further modified by AI paraphrasers or bypassers」(AI の言い換えツールや回避ツールによってさらに改変された可能性のある、AI 生成の可能性が高いコンテンツを引き続き検出する)と述べています。画面の上では色が減りましたが、その下にある検出の主張は同じです。

これには実用的な意味があります。紫色の入ったスクリーンショットを見ているなら、そのレポートは現在のルールの下で生成されたものではありません。Turnitin の説明では、この更新は新しく提出されたファイルに適用され、すでに提出済みのものは更新後のレポートを得るために再提出が必要だとされています。レポートから何かを判断する前に、その日付を確認してください。Turnitin の AI 執筆レポートの読み方には、現在の数値に何が含まれるかが書かれています。

同じページが「数値を動かすもの」として挙げていること

例えば長さです。しかも、多くの人が驚く方向に働きます。短い文章では、より安全な結果ではなく、より粗い結果になります。

「In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap. This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated.」(数百語しかない短い文書では、重ね合わせの機会がないまま単一の区間について予測することになるため、予測はほとんど 'all or nothing' になります。これは、AI 生成のコンテンツと自分で書いたコンテンツが混ざっているテキストの一部が、全体が AI 生成であると判定されうることを意味します。)

これは文書の性質であって、それを書いたのが誰かという話ではありません。Turnitin が自社の誤りを説明するときに挙げている性質についても、同じことが言えます。

「Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas.」(偽陽性、つまり人間が書いたテキストを誤って AI 生成と判定することは、構造的な変化に乏しいコンテンツ、文字どおり同じことを繰り返すテキスト、あるいは新しい考えを展開せずに言い換えられたテキストを含む場合があります。)

構造的な変化、繰り返し、展開しない考え。どれも、出どころを隠したまま測定できるものです。そしてどれもベンダーではありません。これは「モデルを乗り換えても無駄だ」という話にはなりません。ページはその比較を扱っていないので、そう見せかけるのは不誠実です。ただ、人々が最も時間をかけている変数こそ、彼ら自身のドキュメントが最も多くを語らない変数だということです。自分で書いたものについて判定を受けたなら、回答を準備することの方が、午後の使い方としては有意義です。

私たちの立場にある企業が正直に言えること

私たちは文章の書き換えツールを販売しています。ですから、この節はそのことを念頭に置いて読んでください。私たちは検出の結果をお約束しません。それは謙遜ではありません。検出システムは更新されます。公開されている Product Updates のページには、8月4日のレポート変更が記録されています。それだけで、誰が別の通知を受け取ったかについて何も語らずに、レポート自体が変わりうることは示せます。

対象範囲と費用は正直に説明できます。そして HumanPenというツール が説明しているのは、まさにそこです。Turnitin や iThenticate のレポートは、実は座標の一覧です。ファイルと一緒にそれを渡していただければ、書き換えはその座標の内側に限定されます。外側にある文は、あなたが与えた表現のままです。クレジットは、どれだけの散文が変更されたかを数えるものであり、ファイルの大きさを数えるものではありません。条件を満たす箇所は、無料で再実行できます。

この種のものを一切使わない方がよい場面も、実際にあります。それは文書単位の書き換えツールが適切でないときに、別途まとめています。私たち自身のページから引用した6つの状況です。どれも、正直な答えは「あなた自身の手」です。

よくある質問

Copilot が挙がっていません。それは助けになりますか? 読んだ5つのページは、Copilot 固有の結論を与えてくれません。FAQ の「tools based on these LLMs」(これらの LLM に基づくツール)についての一般的な条項は、あるツールが一覧に載ったモデルを使っている場合には当てはまるかもしれません。しかし私たちは、特定の Copilot 製品、モード、日付の背後にあったモデルを特定できていません。名前がないことは、ある1つの提出物の結果を予測できません。

一覧に載ったモデルのどれかが、他より安全ですか? 読んだページには、モデルごとの安定した序列はありません。Product Updates やリリースノートは、対応範囲の変更を説明するときにモデル名を挙げることがありますが、それは次のファイルについての確率表ではありません。誰か自身の提出物から得たパーセンテージは別種の証拠であり、そのように読むべきです。この一般版は、同じテキストが検出器ごとに異なるスコアになる理由にあります。

この話はスペイン語や日本語の提出物にも当てはまりますか? それらには別の検出モデルが使われ、公開されている詳細もページによって異なります。Product Updates は2026年5月5日のスペイン語の更新で GPT と Gemini のバージョンを挙げていますが、検出モデルの変更履歴は別のページとして、同じ一覧なしでそのリリースを要約しています。Turnitin の一般的なリリースノートは第三の情報源であり、どちらかのページの別名というわけではありません。言語の境界については、Turnitin は英語以外の提出物の AI を検出できるのかに詳しく書いています。

採点者は、私がどのモデルを使ったのかを見られますか? 私たちが読んだ現在のレポートのドキュメントが説明しているのは、人間による可能性が高いか AI による可能性が高いかという出力であり、モデル名の欄ではありません。2026年8月4日以降、レポートが示す AI 生成のカテゴリーは1つだけです。そして統合の理由として同社が挙げたのは、「that could be read to imply more certainty about the specific tool or workflow used to produce a submission」(提出物の作成に使われた特定のツールや作業手順について、より確からしさを含意すると読まれかねない)区分を取り除くことでした。

一覧に載っているモデルの古いバージョンを使いました。結果は違いますか? 読んだページからは、それを予測できません。バージョンは FAQ の一覧に個別に現れ、それぞれに括弧書きの日付が付いています。しかし2つのコピーは一部の日付で矛盾しており、どのバージョンにも結果の数値は結びついていません。日付付きの対応範囲の更新があったとしても、ある1つのファイルを予測することにはなりません。

続きを読む