Turnitin 2023 年的句子级约 4% 误报数据,究竟指什么

Turnitin 在 2023 年 6 月公布过约 4% 的句子级数字,它与文档级“低于 1%”目标的统计口径不同。20% 是检测判定门槛,不是论文实际含有 AI 文本的前提;两个数字都不能单独裁定某段文字是谁写的。

HumanPen 团队

· 5 分钟

4% 到底说的是什么

Turnitin 在 2023 年 6 月的说明中,将已经被标为 AI 写作的句子里可能由人写的比例描述为约 4%。这是关于已标记句子的统计,不是对你今天这份报告中某一句话校准过的概率。它也不是所有人写句子中会被标记的比例。

Turnitin 首席产品官 Annie Chechitelli 在 2023 年 6 月的说明中这样写道:

"Our sentence-level false positive rate is around 4%. This means that there is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written. The incidence for this is more common in documents that contain a mix of human- and AI-written content, particularly in the transitions between human- and AI-written content."(我们的句子级误报率约为 4%。这意味着,某个被标为 AI 写的句子有 4% 的可能是人写的。这种情况在人和 AI 混合写作的文档中更常见,尤其是人写和 AI 写的交界处。)

这里的条件是句子已经被标记。文档级误报率问的则是:人写文档有多大比例触发了检测判定规则。两者的分母不同,不能把一个百分比直接换算成另一个。

文档级那个低于 1% 的数

同一篇 2023 年 6 月的博客还给出了文档级数字:

"Our document false positive rate - incorrectly identifying fully human-written text as AI-generated within a document- is less than 1% for documents with 20% or more AI writing."(我们的文档级误报率——即把完全由人写的文本错误识别为 AI 生成——在 AI 写作检测结果达到 20% 或以上的文档判定条件下低于 1%。)

这句容易读反:20% 指检测器报出的结果,不是事先已知论文里实际有多少 AI 文本。Turnitin 的 2024 年 8 月白皮书解释了文档判定规则:超过 20% 的句子分数越过模型阈值。它用 2019 年之前的学生论文测试误报,并明确把这批论文描述为完全由人写。人写论文越过检测门槛,才构成这里的误报。

完全自己写的论文,该怎样理解这两个数

文档级误报测试恰恰需要完全由人写的论文。 检测规则用了 20% 门槛,并不意味着纯人写论文被排除在测试之外。

2023 年的博客说,错标句子在人和 AI 混合写作的文档里更常见,尤其是两者交界处。“更常见”不等于“只会发生在这里”,不能据此排除纯人写文档里的错标。

“低于 1%”目标描述的是:在厂商测试条件下,人写文档触发指定检测规则的频率。它不等于“这篇已经被标记的论文由人写的概率低于 1%”;那样理解,把统计的条件反过来了。

两个数字都能帮助说明误报的可能性,却不能识别你某一段文字的作者。应当回到被标记的内容与写作过程核查,而不是拿一个统计率当裁决。

误报集中在哪里

Turnitin 给了一个具体数字,说这些标错的句子出现在什么位置:

"As explained in my earlier article, there is a correlation between these sentences and their proximity in the document to actual AI writing. 54% of the time, these sentences are located right next to actual AI writing."(正如我在之前的文章中解释的,这些句子与它们在文档中跟真实 AI 写作的距离之间存在相关性。54% 的情况下,这些句子紧挨着真实的 AI 写作。)

“这些句子”指人写的、却被错误标记的句子。按 2023 年这份说明,其中 54% 紧挨着真实的 AI 文本。这描述的是错误集中出现的位置,不是覆盖所有误报的规则。

这个观察不能诊断你这篇论文被标记的原因:它既不能证明附近存在 AI 文本,也不能排除没有 AI 文本时发生误报。高亮可以帮助定位要核查的内容,相邻位置的统计不能裁定作者身份。

Turnitin 自己说该怎么看标红

同一篇博客把话说得很直:标红是一个起点,不是一个结论——而且这话是说给老师听的,那正是你希望看到它的人:

"Consider highlighted sentences as areas of interest because they're predicted to be close to where AI writing is present. But a small percentage of times, the AI model could get it wrong. So, use the information to initiate a conversation, not to draw a conclusion."(把被标红的句子当作值得关注的区域,因为预测它们靠近 AI 写作所在的位置。但在少数情况下,AI 模型可能弄错。所以,用这些信息来发起对话,而不是下结论。)

它还否掉了学生最容易自己脑补出来的那个前提:并不存在一个你该去凑的数。

"Remember that there is no 'right' or 'target' score with the AI writing indicator, just like with a Similarity Score."(记住,AI 写作指标没有所谓的"正确"或"目标"分数,就像相似度分数一样。)

报告上只有两句被标红,你能做的事

上面这些并不能告诉你有没有麻烦——没有任何一个公开数字能。它们能给你的是另一样东西:把这场对话拉回到报告本身,而不是停在一个百分比上。

  • 问清楚是哪几段,并且要报告本身,不要截图。 两句标红和一个文档级数字是两样东西。标红是唯一带位置、你能指着说的那部分。
  • 问清楚对方引用的是哪个率,以及它测量什么。 20% 门槛针对检测器的输出。文档级误报率在人写文本上测量,不是你这篇已被标记的论文由人写的概率。
  • 把 Turnitin 自己的那句话带上。 它告诉老师:标红是用来开启一次对话的,不是用来下结论的。这句话本来就是说给拿着你报告的那个人听的,上面已经逐字引了。
  • 留好能显示论文是怎么写出来的东西——草稿、版本历史、笔记、你读过的材料。那是关于作者身份的证据,百分比不是。

继续阅读