学校如何使用 AI 检测工具(以及学生应该了解什么)
SUS IT
客观审视教育工作者如何部署 AI 检测器、由此引发的公平性问题、学生如何提前自查作业,以及一个有效的申诉流程应该是什么样子。
中小学和大学正在将 AI 检测作为众多参考信号之一加以采用——而不是唯一的真相来源。理解这些系统在实际机构环境中是如何运作的,有助于学生更建设性地使用像 SUS IT 这样的工具,而不是把单一的百分比分数当作最终定论。
学校为何开始使用检测工具
学术诚信政策的制定,远早于生成式 AI 的出现。当 ChatGPT 在 2022 年末推出时,各机构都在仓促应对。最初一批机构政策相当粗糙——有些学校彻底禁止任何形式的 AI 辅助,有些则要求对任何 AI 使用都进行披露。检测工具让教师有能力在规模化的场景下筛查违规行为,尽管并不完美。如今,大多数学校都把 AI 检测视为众多数据点之一,与成绩历史、写作风格分析以及与学生的直接对话共同参考。
检测在实际中是如何部署的
不同机构采取的方式各不相同。有些机构直接把商业检测工具集成进学习管理系统,于是每一份提交的文档都会被自动扫描。另一些机构则采用选择性方式——只有当老师怀疑某处不对劲时才进行扫描。还有一种模式把检测当作一种威慑:学生被提前告知作业可能会被扫描,这本身就能改变行为,而不必真的逐一分析每份文档。无论采用哪种方式,负责任的项目都会把自动检测与人工审核结合起来。分数超过某个阈值,触发的是进一步调查,而不是定罪。
检测工具究竟在衡量什么
AI 文本检测器分析的是写作的统计特征。其中最重要的两个信号是困惑度(perplexity,即根据上文推断,每个词的选择有多“出乎意料”)和爆发度(burstiness,即句子长度和复杂程度的变化幅度)。AI 生成的文本往往表现为低困惑度和低爆发度:用词可预测,句子节奏也很一致。人类写作在这两项指标上通常都更高,变化更多,措辞也更容易出人意料。问题在于,正式的学术写作——恰恰是学生被要求完成的那种文体——本身也倾向于低困惑度和低爆发度,这就是为什么在学术场景下误判率比日常写作场景更高的原因。
误判问题
误判是一个已被记录在案的问题,尤其容易出现在非英语母语学生、具有某些特定写作风格的学生,以及高度技术化或正式化的文体中。一名用第二语言撰写技术性工程报告的学生,即便每个字都是自己写的,写出来的文本读起来也可能在统计上很像 AI 生成的内容。负责任的机构会考虑到这一点。如果你所在的机构使用了 AI 检测,而你收到了一个标记,你有权了解触发这个标记的具体原因,也有权提交反证。
学生在提交前能做些什么
学生能做的最有效的事,就是在截止日期前先自查一遍作业。把自己的草稿放进 AI 检测器跑一遍,能让你看到具体的分数,并据此进行调整。如果出现标记,可以针对语调和具体性进行修改——加入具体的例子、个人视角,以及更多样化的句式结构。把笔记、大纲和早期草稿保存在带版本记录的文档中,这样一旦被质疑,你就能证明自己思路的演变过程。Google Docs 的修订历史就是一份直截了当的证据,能证明一篇文章是随着时间逐步写成的,而不是一次性生成的。
对标记提出申诉
如果你提交的作业被标记,而你确定这是自己的原创作品,第一步是保持冷静,并把一切都记录下来。收集你的研究笔记、草稿、研究过程中的浏览记录,以及任何能证明你的创作过程的其他证据。向你所在的机构了解其申诉流程如何运作——大多数学术诚信政策都包含正式的申诉程序,而这个程序正是你有权使用的。来自另一个工具的独立复检有时能提供额外的参考信息,尽管它无法提供绝对的确定性。一份有力申诉的核心,在于完整的证据链:证明这份作业是随着时间逐步演化而成的,而这种演化方式是 AI 生成无法解释的。
更大的图景
检测工具只是关于“学术作业到底是为了什么”这场更广泛讨论中的一部分。写作作业的目的从来都不是那份文档本身——而是学生在完成它的过程中锻炼出的思考、研究和表达能力。那些绕过这一过程的 AI 工具,损害的正是这项作业本应实现的教育目的。与此同时,帮助学生整理思路、改善语法或检查作业的 AI 辅助,则是另外一回事。这条界线本就模糊,这也正是为什么清晰的机构政策、诚实的学生行为和公平的检测做法都同样重要。检测是用来支持诚信的工具,而不是用来惩罚诚实学生的武器。