人工智能

牛津博德利图书馆藏书被曝用于 OpenAI 训练:数字化合作引发学术数据争议

2026年9月27日 · admin
OpenMagic API

据 IT之家援引英媒《卫报》消息,牛津大学允许 ChatGPT 开发商 OpenAI 使用其博德利图书馆的部分历史典籍,用于人工智能模型训练。博德利图书馆是牛津大学主要研究图书馆,也是英国规模仅次于大英图书馆的第二大图书馆。来源显示,牛津大学曾在 2025 年 3 月宣布与 OpenAI 合作,借助其软件推进馆藏数字化,公开说法强调方便学生和研究人员查阅文献;但一份内部文件显示,由 OpenAI 完成数字化的部分馆藏已被用于“构建 OpenAI 的训练集”,这使合作的机器学习用途受到外界关注。

从“文献数字化”到“训练数据”:争议焦点在哪里

这起事件的核心并不只是图书馆是否应该数字化,而是公共学术资源在进入商业 AI 训练流程时,边界如何界定。来源提到,牛津大学在宣布合作时主要强调文献开放与研究便利,并未在公告中突出这些资料会被用于训练 OpenAI 模型。随后,根据《信息自由法》调取的会议纪要显示,校内包括博德利管理委员会成员在内的教职员工曾表达担忧,认为合作可能带来声誉风险,同时也关注 AI 相关高能耗技术与大学环保承诺之间的冲突。

OpenAI 方面则表示,很荣幸能够促成当今 AI 模型“为后世守护人类历史文化瑰宝”。其发言人还称,全球已有超过十亿人在日常生活中使用相关技术,因此让模型反映不同文化、历史和视角十分重要。牛津大学方面否认向公众和学生隐瞒机器学习用途,称数字化确实是学校的核心诉求,但教职员工始终明确承认项目会为模型提供训练数据。

哪些资料被纳入合作范围

来源显示,截至 2025 年 6 月,博德利图书馆已向 OpenAI 提供 12.5 万份历史学位论文的扫描影印页,内容涵盖 19 至 20 世纪欧美高校博士论文。其他已扫描文献还包括一批罕见的 16 世纪“宽边民谣 / 街头民谣”收藏,共计 1 万首,记录了都铎王朝时期街头流传的歌词与乐谱。

此外,教职人员还讨论过后续数字化计划,可能涉及 18 世纪爱尔兰国家档案、爱尔兰小说家玛利亚·埃奇沃思的私人信函,以及多萝西·霍奇金关于青霉素研究的实验笔记。牛津大学表示,与 OpenAI 合作完成数字化的文献规模有限,且均已超出版权保护期;OpenAI 的使用权为非排他性,博德利图书馆仍保留自主发布这些数字化资源的权利,并计划在未来几个月逐步在线公开。

  • 合作主体:牛津大学博德利图书馆与 OpenAI。
  • 公开目的:推进历史文献数字化,提升学生、研究人员和公众获取便利。
  • 争议点:数字化成果被用于 OpenAI 训练集,公告披露与公众认知之间存在落差。
  • 校方回应:资料已过版权期,使用权非排他,图书馆将继续公开数字化资源。

影响解读:AI 公司为何盯上图书馆与学术机构

对大模型公司来说,高质量语料正变得越来越稀缺。开放网页、论坛和通用文本虽然数量庞大,但质量参差不齐,且涉及版权、隐私与重复内容问题。图书馆、大学档案和学术机构掌握的历史文献,往往结构清晰、来源可靠、文化跨度大,能够帮助模型补充长尾知识与人文语境。因此,OpenAI 等公司与研究型图书馆合作,本质上也是在寻找更可信、更稀缺、更具文化价值的训练材料。

但这类合作也会持续引发治理问题:公共文化机构提供的资源,是否应服务于商业模型能力提升?如果数字化成本由 AI 公司承担,公众、学校和企业之间的利益如何分配?对于已经过版权期的文献,法律障碍可能较低,但透明度、伦理审查和社会信任仍不可忽视。

从产业趋势看,围绕训练数据的竞争正在从“抓取互联网”转向“获取高质量授权数据”。博德利图书馆事件说明,未来 AI 模型的能力差异,可能不仅取决于算法和算力,也取决于谁能获得更丰富、更权威的语料来源。对高校和图书馆而言,如何在开放知识、保护声誉、控制合作边界之间取得平衡,将成为与 AI 公司合作时必须回答的新问题。