エッセイの構成がTurnitinのAIスコアに与える影響

エッセイの構成によって、AIスコアは変わり得ます。TurnitinのFAQは、構造的な変化に乏しい文章、文字どおり繰り返される文章、新しい考えを加えずに言い換えた文章を、誤検知が起きやすい例として挙げています。2023年のリリースノートには、文書の最初と最後の文が誤検知されやすいという傾向が記されています。ここでは、ドキュメントに実際に書かれていることを取り上げます。

HumanPen チーム

· 5 分

短く言えば

エッセイの構成がTurnitinのAIスコアに影響し得るのは、FAQが誤検知を生む構造上の特徴を明示的に挙げているためです。そこには "content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(構造的な変化に乏しい内容、文字どおり繰り返される文章、あるいは新しい考えを展開せずに言い換えられた文章)が含まれます。FAQは教員に対し、そのような文章では "take that into consideration when looking at the percentage indicated"(示された割合を見る際にはその点を考慮に入れること)を勧めています。2023年五月のリリースノートにも、文書の最初と最後の文で誤検知の発生率が高くなる傾向が記されており、それは多くの場合 "introduction or conclusion content written in a generic way."(ありきたりに書かれた導入部や結論部の内容)で構成されているためです。判定ロジックはこれを減らすために変更されましたが、ありきたりな導入と結論という根本的な構成パターンは残っています。文のリズムが均一であったり、同じ言い回しが繰り返されていたり、導入と結論が決まりきった形であったりする場合、内容がすべて自分のものであっても、そうした特徴がスコアを押し上げることがあります。

構造の変化と誤検知

FAQは、誤検知を生みやすい具体的な文章の特徴として次を挙げています。

"Sometimes false positives (incorrectly flagging human-written text as AI-generated), can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas."(誤検知(人が書いた文章をAI生成と誤って判定すること)には、構造的な変化に乏しい内容、文字どおり繰り返される文章、あるいは新しい考えを展開せずに言い換えられた文章が含まれることがあります。)

続く文はこうです。"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."(そのような文章でAIによる執筆の割合が高く示された場合、示された割合を見る際にはその点を考慮に入れることをお勧めします。)

つまりFAQ自身が、人が書いた文章の特定の構成パターンがAIスコアを押し上げ得ることを認めているわけです。どの段落も同じ構成になっている、文の長さやリズムが似通っている、強調のためにキーフレーズを繰り返している、といったエッセイは、この誤検知の傾向に当てはまり得ます。公式のガイダンスは、そのような文章では割合を決定的なものとして扱わないよう求めています。よく書けたエッセイがAI検出器に判定される理由は、同じことを文章の質の側面から見たものです。

モデルはどのように文章を評価するのか

検出モデルは、対象となる散文を重なり合う区間に分割して処理します。

"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1, denoting the probability of the text being likely human or AI-generated."(論文がTurnitinに提出されると、提出物から文が抽出され、予測分析のために重なり合う区間に分割されます。それぞれの区間はAI検出モデルによって分類され、0から1の間の値が与えられます。これは、その文章が人によるものかAIによるものかという確率を示すものです。)

モデルはburstinessやperplexityという名前の指標を評価するようには作られていません。"Our model is not explicitly programmed to evaluate specific signals such as 'burstiness,' 'perplexity,' or other individual metrics sometimes referenced in public discussions."(私たちのモデルは、'burstiness'、'perplexity'、あるいは公開の議論で時に言及される他の個別の指標といった特定のシグナルを評価するようには明示的にはプログラムされていません。)続く文はこうです。"Instead, it learns statistical patterns from our training data."(その代わりに、学習データから統計的なパターンを学びます。)同じFAQには次の記述もあります。"Our classifiers are trained to detect these differences in word probability and are adept at the particular word probability sequences of human writers."(私たちの分類器は、こうした単語の確率の違いを検出するように訓練されており、人が書く文章に特有の単語確率の並びに精通しています。)つまりモデルが評価しているのは表層的な指標ではなく単語の確率パターンですが、それでも文の構造が均一だと、モデルがAI生成文を連想するパターンが生じることがあります。AI検出器はperplexityやburstiness以外に何を見ているのかにより詳しい説明があります。

導入と結論

2023年五月のリリースノートには、提供開始以降に観察された傾向が記されています。

"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way."(提供開始以降、文書の最初の数文あるいは最後の数文で誤検知が発生する割合が高いことを確認しています。それらの文は、ありきたりに書かれた導入部や結論部の内容であることが少なくありません。)

続く文はこうです。"As a result, we have changed our detection logic to help reduce these false positives."(その結果、これらの誤検知を減らすため、私たちは検出ロジックを変更しました。)

これは2023年の改善であり、現在の不具合ではありません。これらの位置での誤検知を減らすため、検出ロジックは更新されました。とはいえ根本的な傾向は残っています。導入と結論は、AIの出力に似うる、ありきたりで決まりきった言葉遣いになりがちです。広い主張で書き始め、主要な点を繰り返す要約で締めくくるエッセイは、本文の段落よりも誤検知を受けやすいままである可能性があります。

短いエッセイと全部かゼロかの予測

FAQは、短い文書が検出モデル下でどのように振る舞うかを説明しています。

"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."(数百語しかない短い文書では、重ね合わせの機会がないまま単一の区間に対して判定を行うため、予測はほぼ'all or nothing'(全部かゼロか)になります。)

続く文はこうです。"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated."(これは、AIが生成した内容と自分で書いた内容が混ざっている文章の一部が、全面的にAI生成と判定される可能性があることを意味します。)

短いエッセイがこの問題に直面するのは、モデルが評価できる区間が少ないためです。個々の判定のぶれをならす重なり合う区間がないため、スコアは二値的になります。構成が均一な導入部を持つ500語のエッセイは、実際に混在している人間の文章とAIの文章の割合を反映しない極端なスコアを受け取ることがあります。

割合は唯一の判断材料ではない

FAQは、スコアを決定的なものとして扱うべきではないと強調しています。

"Hence, we must emphasize that the percentage on the AI writing indicator should not be used as the sole basis for action or a definitive grading measure by instructors."(したがって、AI執筆インジケーターの割合は、対応を判断する唯一の根拠として、あるいは教員による決定的な評価指標として用いられるべきではないことを強調しておかなければなりません。)

これがエッセイの構成に関係するのは、構成が均一な文章がスコアを押し上げ得るからです。自分のエッセイがFAQの述べる誤検知を招きやすい特徴に当てはまる場合、割合は実際のAI関与を過大に示す可能性があります。ドキュメント自身のガイダンスは、スコアを単独の判定としてではなく、他の証拠と併せて検討するよう求めています。では、判定を避けるために書き方を変えるべきかどうかは別の問題です。判定を避けるために書き方を変えるべきか

あなたにとっての意味

ここまでの内容をまとめます。

  • FAQは、構造的な変化の少なさ、文字どおりの繰り返し、新しい考えを伴わない言い換えを、誤検知を招きやすい特徴として挙げている。
  • そのような文章については、割合を"take into consideration"(考慮に入れる)よう教員に助言している。
  • 2023年のリリースノートは、最初と最後の文に集中した誤検知について記しており、それは多くがありきたりな導入部や結論部の内容だった。
  • 検出ロジックはこれを減らすために更新されたが、構成のパターンは残っている。
  • 短いエッセイは、単一の区間で判定されるため、全部かゼロかの予測を受ける。
  • FAQは、割合を対応を判断する唯一の根拠として用いるべきではないとしている。

TurnitinのAIレポートを受け取り、判定された箇所に対応したい場合は、レポートを取り込んで作業しましょう。対象となる箇所は無料で再実行できます。

続きを読む