Turnitin 的误报率,讲清楚
Turnitin 的“低于 1%”目标,是人写文档在指定检测规则下被误判的比例。本文解释 20% 门槛、厂商公布的测试方法,以及为什么高分和低分都不能单独裁定作者身份。
HumanPen 团队
· 5 分钟
Turnitin 官方怎么说误报率
Turnitin 在官方文档里直接写了这个目标:"We strive to maximize the effectiveness of our detector while keeping our false positive rate - incorrectly identifying fully human-written text as AI-generated - under 1% for documents with over 20% of AI writing."(我们努力提高检测器的有效性,同时将误报率——把完全由人写的文本错误识别为 AI 生成——在 AI 写作检测结果超过 20% 的文档判定条件下控制在 1% 以下。)
20% 条件针对检测器的输出,不是已经确认论文里实际有多少 AI 文本。Turnitin 的 2024 年 8 月白皮书描述的文档规则是:超过 20% 的句子分数越过模型阈值。误报测试使用的是它明确描述为完全人写的论文。被统计的错误,就是人写论文越过了这个检测门槛。
文档级误报率问的是:人写文档有多大比例触发了检测规则。它不给出“某篇已经被标记的论文由人写的概率”。这两个问题把条件反了过来,单靠测试结果不能回答后一个问题。高分也仍需核查,见Turnitin AI 查重率 100% 有可能是自己写的吗。
70 万篇论文的复验
Turnitin 的 FAQ描述了目标背后的测试:"To bolster our testing framework and diagnose statistical trends of false positives, before every update or new model release, we perform tests on over 700,000 additional academic papers that were written before the release of ChatGPT to further validate our less than 1% false positive rate."(为加强测试并分析误报的统计趋势,我们在每次更新或发布新模型之前,对超过 70 万篇写于 ChatGPT 发布前的额外学术论文进行测试,进一步验证低于 1% 的误报率。)
这段话给出了较大的测试规模、论文早于 ChatGPT 发布的时间条件,以及每次更新或发布模型前测试的安排。它没有说每次都会重新收集一批论文。2024 年 8 月白皮书另将一批 2019 年前的压力测试语料描述为完全由人写。
引用这个率时,要把检测门槛与测试语料一起交代。语料的规模和年代,都不能让测试结果变成对所有学科、文风或单篇提交的保证。
为了守住低误报率,官方接受漏检
文档明确说明,为了减少误报,Turnitin 接受一定的漏检:"In order to maintain this low rate of 1% for false positives, there is a chance that we might miss some AI written text in a document. We're comfortable with that since we do not want to incorrectly highlight human-written text as AI-written. For example, if we identify that 50% of a document is likely written by an AI tool, it could contain as much as 65% AI writing."(为维持 1% 的低误报率,我们可能漏掉文档中一些 AI 写作。我们接受这一点,因为不想把人写文本错标成 AI。例如,我们判定文档中有 50% 的内容可能由 AI 工具写作,它实际可能含有多达 65% 的 AI 写作。)
厂商在这里明确了取舍:为了减少错标人写文本,可以接受漏掉一些 AI 文本。这个设计目标不等于消除了误报。
50%/65% 的例子说明可能发生少报,不是换算公式,不是其它文档真实比例的上界,也不能证明所有错误都朝同一个方向。文档同时承认,人写文本可能被错认成 AI 生成。
这个数字怎么读
只要把限定语一直带着,"误报率"就比标题党版本精确得多。官方数字实际上意味着下面几点。
第一,区分报告上的 AI 百分比与真实作者来源。20% 切分点属于检测规则。完全由人写的论文也可能越过它,这恰恰是误报测试要统计的错误。
第二,漏检是设计的一部分。因为系统以误报为优化目标,一部分 AI 文本会漏过去。一个不算高的报告分数,并不能可靠地说明文档完全是真人写的;它可能只意味着 AI 内容被低估了。
第三,接受漏掉一些 AI 文本,并不能证明你这份报告中的高分更可信。所引例子没有量化一个 80% 分数有多可靠,仍需要核查被标记的段落及其写作过程。
低分不能证明由人写,高分也不能认定学术不端。仅凭这段取舍说明,无法比较你所在场景里漏检与误报的发生频率。可接着看AI 比例偏高时,厂商是怎么教老师处理的。
误报了怎么办
Turnitin 的指导意见要求把分数放在更大的判断框架内:"Our AI writing detection model may not always be accurate (it may misidentify human-written, AI-generated, and AI-paraphrased text), so it should not be used as the sole basis for adverse actions against a student."(我们的 AI 写作检测模型不一定总是准确,可能错认人写、AI 生成或 AI 改写的文本,因此不应作为对学生采取不利措施的唯一依据。)
它继续写道:"It takes further scrutiny and human judgment in conjunction with an organization's application of its specific academic policies to determine whether academic misconduct has occurred."(是否发生学术不端,需要进一步核查和人工判断,并结合机构对具体学术政策的执行。)
这就是学生和教师应该在其中运作的框架。百分比是一个数据点。判决是由人做出的决定:教师、院系、学校机构,按照他们自己的学术政策来执行。Turnitin 自己都说分数不应该独自承担决定。厂商那边还有一条专门反馈误报的通道,见如何向 Turnitin 报告误判。
如果你不同意某个分数,文档给出的路径是:把这个数字当一个数据点,向掌握学业背景的人——你的老师——提出。这是官方文档描述的那一步,也是与公司自己定位最一致的一步。如果谈不拢,下一步见被误判为 AI 写作:怎么申诉,学校会认哪些证据。
为这场讨论保留原始报告和写作记录。如果之后决定修改文稿,HumanPen 的报告定位工作流可用于处理报告标出的段落;它不判断原来的标记是否正确。
继续阅读