2026年2月16日,西澳大学(UWA)副校长(教育与学生体验)Guy Littlefair在学校官网上发布了一篇署名文章。文章的语气平静,但其中一句话的分量,在澳大利亚高等教育界掷地有声。
Littlefair写道,学校决定不使用任何AI检测工具,因为“证据不断表明,这类工具不可靠、不公平,不适合用于高利害评估决策”。
“不可靠”“不公平”——这两个词在高校的AI政策声明中并不罕见。但真正让西澳大学的立场独树一帜的,是文章中使用的一个更直接的判断:“不道德”(unethical)。学校明确表示,基于一个不公平的工具来指控学生,本身就是一种不道德的行为。
这不是一所高校在“限制使用”和“全面停用”之间徘徊的中间路线。西澳大学选择了最彻底的一条路:工具本身不使用。在澳大利亚八校集团(Group of Eight)中,至少有一半的成员已经做出了同样的决定。
一、西澳大学的决策拆解:不是“不准”,是“不公平”
要理解西澳大学这个决定的力度,需要先看清楚它跟其他高校停用AI检测工具的区别。
耶鲁、范德堡、约翰斯·霍普金斯停用的是Turnitin的AI检测功能,查重功能仍然保留。牛津不推荐使用AI检测工具,但没有点名Turnitin。科廷大学关闭的是AI检测模块。这些决策的矛头都指向“AI检测不准确”。
西澳大学的选择不一样。它停用的是“任何AI检测工具”,原因不是“检测不准”,而是“不公平”和“不道德”。
表:西澳大学停用AI检测工具的决策拆解
| 规则维度 | 具体内容 | 与其他高校停用决策的区别 |
|---|---|---|
| 停用范围 | 任何AI检测工具 | 耶鲁、范德堡仅停用Turnitin AI检测功能 |
| 核心原因 | 工具不可靠、不公平、不适合高利害评估 | 其他高校多聚焦于“准确性不足” |
| 道德判断 | 基于不公平的工具指控学生是不道德的 | 多数高校未上升到道德层面 |
| 替代方案 | 重新设计评估方式,强化学习过程 | 牛津配套了过程组合档案 |
| 集团立场 | 八校集团中至少一半已做出同样决定 | 澳大利亚高校集体转向 |
西澳大学的文章没有停留在“检测工具不好用”这个层面。它把问题上升到了一个更根本的层面:如果一个工具被证明对某些群体存在系统性偏见,那么用它来判定学生的学术命运,本身就是一个道德问题。
二、西澳大学不使用的依据:一组让高校沉默的数据
西澳大学的决策不是一时冲动。Littlefair在文章中明确提到,学校“一直在密切关注这一领域的发展,证据不断表明这类工具不可靠、不公平”。
这些证据指向几个方向。斯坦福大学2023年的一项研究揭示了一个令人不安的事实:超过一半的中国学生用英语写的论文,在ChatGPT发布之前撰写,却被AI检测工具错误地标记为AI生成。而美国学生的论文则被分类得准确得多。研究人员将这种偏见归因于词汇和句子复杂度的差异——非母语写作者的规范化表达,在检测系统的统计视角下,与AI生成文本的特征边界并不清晰。
一项2025年的研究报告了一个更具体的数字:GPTZero能够正确检测出许多AI生成的论文,但将大约16%的人类撰写的文章错误地标记为AI生成。这意味着每六篇人类写的论文中,就有一篇会被误判。
表:AI检测工具误判风险的实证数据
| 研究来源 | 样本类型 | 关键发现 |
|---|---|---|
| 斯坦福大学研究 | 非母语英语写作者的论文 | 超过一半被误判为AI生成,母语者几乎不受影响 |
| 2025年GPTZero测试 | 人类撰写的文章 | 约16%被错误标记为AI生成 |
| Nature引用的多项研究 | 多款检测工具 | 对新型AI模型的检测能力下降,对人类写作结果不一致 |
| 西澳大学官方立场 | 综合评估 | 工具“不可靠、不公平、不适合高利害评估” |
西澳大学文章中还提到一个细节:即使是美国《独立宣言》这样的历史文本,也曾被某些检测工具反复标记为AI生成。这个例子揭示了一个荒谬的真相——检测工具在做的,不是判断“谁写的”,而是判断“写得像不像机器”。一篇写得足够规范、足够流畅、结构足够清晰的文章,无论作者是谁,都有可能触发警报。
三、句子级案例分析:一段“被AI”的学术论文
西澳大学的决策背后,是一个在全球高校中反复出现的场景。来看一个具体的例子。假设一篇社会科学课程的论文中有这样一段文字:
The relationship between institutional trust and civic participation has been extensively studied in political science. Putnam’s social capital theory posits that dense associational networks foster norms of reciprocity and trust, which in turn facilitate collective action. Empirical studies, however, have produced inconsistent findings. Some scholars find a robust positive correlation, while others report that the relationship is conditional on contextual factors such as economic inequality and ethnic heterogeneity.
这段话句长在22到40字之间,句式全部是“理论框架+学者观点+实证发现+条件判断”的陈述结构,信息密度均匀。在一款基于困惑度和突发性的检测器中,被标记为高AI疑似率的概率很高。
但撰写这篇论文的学生在跟导师交流时说的是:
I started with Putnam because he‘s the canonical reference, but the empirical section was frustrating — every paper I pulled up seemed to point in a different direction. That’s when I realized the problem wasn‘t the theory itself but how different studies operationalize “civic participation.” Some use voting rates, others use volunteering hours, and a few use a composite index. Once I started grouping the findings by measurement approach, the apparent contradictions started making sense.
这段口头解释包含了研究路径的调整、对原始框架的挫败感、数据观察中的发现,以及解决问题的方法。把这些内容注入论文,段落就变成了:
Putnam’s social capital theory was the starting point, but the empirical literature proved difficult to synthesize — each study seemed to point in a different direction. The issue turned out to be measurement: some studies operationalize civic participation as voting rates, while others use volunteering hours or a composite index. Grouping the findings by measurement approach resolved much of the apparent contradiction.
两段文字传递的学术信息实质相同。改写后的段落句长波动明显,包含了“proved difficult to synthesize”“turned out to be”“resolved much of the apparent contradiction”这类带有个人研究过程痕迹的表达。信息密度不均匀——对理论框架的处理压缩在一句里,测量方法的分析展开了两句。
西澳大学的决策在这个案例中的意义在于:一个学生用AI帮助梳理了实证文献,然后用完全属于自己的判断和语言写出论文。检测系统无法区分这跟一个纯粹自己思考的学生写的论文有什么不同。西澳大学的答案是,既然区分不了,而且这种“区分不了”本身对某些群体不公平,那就不应该用一个无法公平区分的工具来判定。
四、西澳大学“不做检测”之后做了什么:评估重设计
西澳大学没有停留在“停用检测工具”这一步。Littlefair的文章明确写道,学校“正在优先重新设计学生评估,以强化有效性、作者身份保证和学术诚信”。
图:西澳大学的“不检测”替代方案
停用AI检测工具
│
├── 不参与基于不可靠工具的对抗性指控
├── 不将检测分数作为评估决策的依据
└── 将资源转向评估重设计
│
▼
评估重设计三大方向
│
├── 强化有效性:设计需要展示真实能力的评估任务
├── 作者身份保证:通过过程材料证明作品的原创性
└── 学术诚信:将诚信教育嵌入评估设计,而非事后检测
│
▼
具体措施
│
├── 学习与评估设计团队(6个月内培训约350名教师)
├── 开发“GenAI韧性评估范例”供教师参考
├── 评估重设计与学术诚信部门协同工作
└── 引入新的诚信集中化流程和改进的报告系统
西澳大学在文章中还提到一个容易被忽略的事实:学校仍然大量使用有监督的期末考试。2025年,学生参加了约98000场受监督的考试。这意味着,西澳大学并不是简单地“放弃检测”,而是在把评估的重心从“事后检测”转移到“过程保证”和“有监督展示”上。
五、分步优化策略:当学校不检测时学生应该怎么做
西澳大学的决策给所有面临AI检测的学生提供了一个参照:当学校不再依赖检测工具时,把“通过检测”作为写作目标,方向就偏了。更合理的策略是让文本和过程材料共同证明研究的真实性。
思维导图:西澳大学模式下的学术诚信准备
- 过程材料层面
- 保留从选题到定稿的每一版草稿
- 记录与导师的交流内容和反馈意见
- 保存数据收集、文献阅读的原始笔记
- 如使用AI工具,明确记录使用范围和目的
- 文本层面
- 长短句交替,避免句长集中在22-40字的“舒适区”
- 注入研究过程中的调整和质疑
- 保留对前人研究的个人判断,而非单纯罗列
- 在论证中加入对自身局限性的认识
- 制度层面
- 了解学校是否要求AI使用声明
- 熟悉课程层面的AI使用规则(西澳大学的规则因课程而异)
- 西澳大学等高校的政策转向表明,过程证据正在取代检测分数成为学术诚信的核心依据
初稿阶段可以用论文查重免费平台摸查重复率趋势,但第三方平台的数据库通常不完整,结果仅供参考。关于查重与AIGC检测逻辑差异的详细说明,可以参考论文查重免费查重过了,为什么还有一个AIGC检测?中关于两者判定机制根本差异的分析。对于修改顺序的实操框架,论文初稿查重与降AIGC实操提供了“先AIGC后查重”的分步操作说明。如果需要了解AIGC免费查重的具体操作路径,站内有分步骤的实操说明可以参考。论文查重系统的核心操作逻辑与AIGC优化有本质区别,理解这一点是制定修改策略的前提。
品牌方面,论文狗在初稿反复检测阶段有它的便利性,paperdog的免费额度适合每天摸查一个段落的AIGC特征变化,文思慧达的结果跟学校系统更接近,适合定稿前的对照验证。但所有这些工具的结果都只能作为趋势参考。
西澳大学说AI检测工具“不道德”,理由其实很简单:一个被证明对非母语写作者存在系统性偏见的工具,如果被用来决定一个学生的学术命运,那就不只是“不准”的问题,而是“不公平”的问题。Littlefair在文章结尾写道,大学面临的挑战“需要的不只是一块创可贴,也不是‘照常营业但用一个有缺陷的工具’的方式”。对于认真做研究的学生来说,这个转向其实是一种保护——你的阅读笔记、修改草稿、导师交流记录,这些才是真正无法被伪造的东西。任何检测系统都替代不了它们。
