短文档的「全有或全无」:为什么几百词的稿子分数会走极端

Turnitin 要靠互相重叠的片段才能给出有层次的 AI 分数。几百词的稿子凑不出足够的片段,结果就变得粗暴。这篇讲清楚重叠机制怎么运作,以及短作业为什么最吃亏。

HumanPen 团队

· 6 分钟

重叠片段是怎么运作的

要理解为什么短文档会产生不可靠的 AI 写作分数,我们首先需要了解 Turnitin 如何处理文本。文档解释道:"When a paper is submitted to Turnitin, sentences from the submission are extracted and segmented into overlapping sections for prediction analysis. Each segment is classified by the AI detection model and given a value between 0 and 1..."

"overlapping"这个词在这里承担着重要作用。Turnitin 不会把你的文档作为一个连续块来分析,而是将文本分割成相互重叠的段落,意味着一个句子可能出现在多个段落中。每个段落获得自己的 0 到 1 之间的预测分数,最终的 AI 写作百分比来自这些单独段落分数的综合。

这种重叠使模型能够产生细致的百分比,而非二元的是或否结果。当段落重叠时,模型可以比较文本不同部分的分类结果。一个位于两个低分段落和两个高分段落之间的段落,有助于形成更审慎的整体预测。没有重叠,模型就失去了三角定位的能力,分数变得不够精确。

只剩一个片段时会发生什么

当文档非常短时,没有足够的文本来创建多个重叠段落。文档直接说明了后果:"In shorter documents where there are only a few hundred words, the prediction will be mostly 'all or nothing' because we're predicting on a single segment without the opportunity to overlap."

单一段落意味着模型对整个文档做出一次预测。没有跨段落的平均计算,因为没有可平均的内容。模型审查文本一次,给出一个分数,那个分数决定了文档是否被标记为 AI 生成。

文档继续写道:"This means that some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." 这就是核心问题。如果你在 300 词的文档中自己写了 200 词并使用 AI 写了 100 词,模型无法区分两者。它将文档作为一个整体来处理,如果这个整体得分超过阈值,整篇文档就会被标记。报告无法显示哪些具体句子是 AI 生成的,因为预测是在文档层面做出的,而非句子层面。

300 词这条线

Turnitin 对提交设置了最低字数要求,技术规格规定下限为 300 词。接受的文件格式为 .docx、.pdf、.txt 和 .rtf,最多 30,000 词,文件大小不超过 100MB。支持的语言为英语、西班牙语和日语。

300 词的下限是一条文件要求:文件「must have at least 300 words of prose text in a long-form writing format」(必须包含至少 300 词的长篇连续正文)。常和它一起被引用的还有一句关于准确率的话——「Results show that our accuracy increases with a little more text so submissions that contain less than 300 words may result in an AI writing score that is likely less accurate.」——但那句出自 2023 年 12 月 15 日的一条发布说明,讲的是一个让未达长度的提交漏过去的 bug,描述的是那个时间窗内生成的那批报告。在今天,低于下限时模型不是给出一个更不可靠的预测,而是根本不给预测。

即使在 300 词或略高于 300 词时,重叠也可能很少。一篇 350 词的文档可能只产生两三个略有重叠的段落,这比一个要好,但离 2,000 词论文的段落密度还差得远。准确性的提升是渐进的。更多文本意味着更多段落、更多重叠,以及模型在同一文档内区分 AI 生成内容和原始内容的更多机会。

混着写的稿子,可能整篇被判成 AI

All-or-nothing 问题在短文档包含原始和 AI 生成混合文本时最为明显。文档指出 "some text that is a mix of AI-generated and original content could be flagged as entirely AI-generated." 对于一个大部分自己写但部分使用 AI 的短作业学生来说,这意味着即使大部分文本是原创的,整篇文档仍可能获得高 AI 写作分数。

某些类型的写作会使这个问题更严重。文档指出:"Sometimes false positives... can include content without a lot of structural variation, text that literally repeats itself, or text that has been paraphrased without developing new ideas." 讨论帖和简短反思这类短作业通常符合这些描述。它们往往比完整的研究论文结构变化更少,可能以相似的句式重复相似的观点。文档建议:"If our indicator shows a higher amount of AI writing in such text, we advise you to take that into consideration when looking at the percentage indicated."

还有一个 Turnitin 已识别并处理的具体模式。2023 年的一項更新指出:"Since launch, we have observed a higher incidence of false positive detection in the first few or last few sentences of a document. Many times these sentences consist of introduction or conclusion content written in a generic way. As a result, we have changed our detection logic to help reduce these false positives." 短文档受开头和结尾内容影响更大,因为这些部分在总文本中占比例更高。2023 年的修复有所帮助,但短文档的结构性脆弱性仍然存在。

讨论帖、短反思这类作业该怎么看

短作业在 AI 检测中面临多重叠加的挑战。段落更少,重叠更少,结构变化更少。更容易包含通用的开头和结尾内容。所有这些因素使得短文档的 AI 写作分数不如长文档可靠。

讨论帖、短篇反思和简短回答论文是高等教育中最常见的短篇作业。如果你正在写这类作业,你应该知道为你的提交生成的 AI 写作报告可能无法区分你的原创写作和任何 AI 辅助部分。一个低分段落就可能将整篇文档翻转为被标记类别。

文档承认这一局限:"Our AI writing detection model may not always be accurate... so it should not be used as the sole basis for adverse actions against a student." 这一声明对于 all-or-nothing 动态起作用的短文档尤为相关。如果你在短作业上收到 AI 写作标记,报告可能反映的是单段落预测的局限性,而非对你写作过程的清晰信号。

Turnitin 还声明:"We strive to maximize the effectiveness of our detector while keeping our false positive rate... under 1% for documents with over 20% of AI writing." 该误报目标适用于具有足够长度以进行可靠分析的文档。短文档处于最优范围之外,误报率可能更高。

我们建议谨慎看待短文档上的 AI 写作分数。作业自己写,开头和结尾避开套话式的措辞;如果已经有一份报告标出了你想处理的段落,可以 只重写这些段落,文档其余部分保持原样。

继续阅读