人工智能

卡迪夫大学研究:ChatGPT 批改本科论文仍不稳定,暂难替代人类教师评分

2026年8月25日 · admin
openmagic ad

据 IT之家援引 Phys.org 8 月 24 日报道,卡迪夫大学与墨尔本大学的一项新研究显示,生成式人工智能目前还无法像人类教师一样,稳定、可靠地评判学生的书面作业。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,并要求模型依据 7 项标准完成批改,同时测试了 4 种不同提示方式。结果表明,AI 给出的总分有时看似接近人工评分,但一旦细分到具体评分标准和单篇论文,差异会明显扩大。

这项研究为当前教育科技和 AI 工具落地提供了一个重要提醒:大模型可以辅助教学流程,但在高风险、强主观的评价场景中,仍不适合直接替代人类判断。尤其是论文、报告等长篇书面作业,评分不仅涉及事实准确性,还包括论证结构、学科理解、表达质量和评估者经验,这些都不是简单的文本模式匹配可以完全覆盖的。

研究如何测试 ChatGPT 的评分能力

来源显示,研究团队选取了 50 篇生物科学专业本科生论文作为测试对象,让 ChatGPT 的两个版本按照 7 项评分标准进行批改。为了观察提示词对评分结果的影响,研究人员还设计了 4 种不同提示方式,再将模型评分与人工评分的平均分以及分数波动情况进行比较。

卡迪夫大学生物科学学院威廉·凯博士指出,模型给出的分数波动很大,无法准确预测人工评分。也就是说,AI 并非只是偶尔“打偏”,而是在不同论文、不同评分维度上表现出系统性不稳定。研究还发现,除一种情况外,AI 模型给出的平均分普遍高于人工评分;在平均分层面,AI 与人工评分的最大差距达到 16.1 分,而具体到单篇论文时,最大差距达到 40 分。

更值得注意的是,研究人员发现 AI 存在一种“向中间靠拢”的倾向:它往往会压低高分论文的成绩,同时抬高低分作业的成绩,使评分结果集中到中间区间。这种现象对于教育评价来说并不理想,因为它可能削弱评分对学生真实能力差异的区分度。

  • 测试对象:50 篇生物科学专业本科生论文。
  • 测试工具:ChatGPT 的两个版本。
  • 评分方式:依据 7 项标准批改,并采用 4 种不同提示方式。
  • 主要结果:总分有时接近人工评分,但单项标准和单篇论文差异明显。
  • 风险表现:AI 可能压低高分、抬高低分,使分数向中间集中。

为什么总分接近不代表 AI 真的会批改

对于很多教育机构和 AI 工具开发者来说,“总分接近人工平均分”看起来似乎是一个积极信号。但这项研究强调,教育评分不能只看宏观平均值。如果一个模型在某些论文上高估很多、另一些论文上低估很多,最终平均分仍可能看似合理,但对单个学生而言,这种误差可能直接影响成绩判断和学习反馈。

从 AI 产品角度看,这也是大模型在专业场景中常见的问题:模型擅长生成结构化、流畅的文本反馈,也能识别一些表层特征,例如文章是否完整、是否有基本逻辑、是否覆盖题目要求。但当任务进入更细粒度的学术评价时,模型需要理解课程目标、评分标准背后的教学意图,以及不同学生答案的细微差别。这些判断往往依赖教师的领域经验,而不是单纯的语言生成能力

此外,提示词并不能彻底解决评分一致性问题。研究中使用了 4 种不同提示方式,说明研究人员并非只测试了简单指令,而是尝试观察提示工程是否能改善表现。结果仍显示,模型与人工评分之间存在明显差距,这意味着在当前阶段,单靠优化提示词还不足以让 AI 成为可靠的评分主体。

对教育 AI 落地的影响:适合辅助,不宜替代

高等教育领域对 AI 批改作业的兴趣并不难理解。大模型具备文本处理和模式识别能力,理论上可以帮助教师节省时间,提升反馈速度,并在一定程度上减轻教职人员压力。但这项研究表明,将 AI 直接用于决定学生长篇书面作业分数,现阶段仍然风险较高

更现实的路径,可能是把 AI 放在“辅助批改”而不是“最终裁判”的位置。例如,AI 可以帮助教师检查作业是否遗漏关键要素,生成初步反馈草稿,提示可能需要重点关注的段落,或协助学生在提交前进行自我修改。但最终评分,尤其是涉及学术判断和主观评价的部分,仍应由教师负责。

研究人员还提到,未经学生明确同意便把作业提交给 AI 工具,本身涉及伦理问题。这一点对学校和教育科技平台都很关键:学生作业通常包含个人表达、学习轨迹甚至未公开研究内容,如果被输入第三方 AI 系统,可能引发数据使用、隐私保护和知情同意方面的争议。因此,教育机构在引入 AI 工具时,除了评估准确率,还需要建立清晰的数据治理和使用边界。

总体来看,卡迪夫大学与墨尔本大学的研究并不是否定 AI 在教育中的价值,而是提醒行业不要过早把大模型包装成“自动评分教师”。随着模型继续迭代,其模仿人类判断的能力可能提升,但从这项研究看,要让 AI 在主观性较强的长篇写作评分中稳定达到人工水平,仍有不小距离。对于中文教育科技市场而言,这一结论同样具有参考意义:AI 批改可以成为效率工具,但不应在缺乏验证和监督的情况下成为成绩裁决者。