珍稀图书被粉碎用于 AI 训练引争议,ISBNdb 下架相关测试页面
据 IT之家 8 月 2 日消息,本周,一则“大量珍贵图书被集中采购、数字化后粉碎,并可能用于大语言模型训练”的消息在海外读者和出版相关从业者中引发争议。事件焦点指向图书数据库网站 ISBNdb:外界认为其曾通过营销页面向 AI 企业宣传图书作为高质量训练数据的价值,并可能帮助 AI 公司与图书供应商建立联系。随着舆论升温,ISBNdb 已删除相关页面,并在声明中称,网站并不训练 AI 模型,也从未开展相关业务,该页面只是一次市场需求测试,服务并未上线。
争议为何集中到 ISBNdb
来源显示,404 Media 此前报道称,多家图书供应商近期突然接到数量异常庞大的图书采购订单。由于学校、图书馆等传统采购方近年来预算趋紧,一些供应商面临经营压力,因此更容易接受大额订单。外界随即猜测,背后买家可能与 AI 公司有关:相比开放网络上的碎片化内容,图书往往经过编辑、筛选和专业积累,被视为更“干净”、更稳定的训练语料。
ISBNdb 之所以成为舆论焦点,是因为其此前删除的宣传页面曾突出强调,书架上的图书是高质量 AI 训练数据来源,包含经过编辑和专业沉淀的知识,其结构化与权威性不同于普通网络爬虫内容。虽然 ISBNdb 最新声明试图与相关业务切割,但这一表述仍被不少网友解读为对“购买实体书—扫描—销毁—训练模型”模式的间接鼓励。
- 供应端:部分图书供应商可能因库存压力而接受异常大额订单。
- 需求端:AI 公司被认为正在寻找版权风险更低、质量更高的训练数据。
- 争议点:珍稀或绝版图书若被破坏性扫描并打成纸浆,将造成文化保存层面的损失。
- 平台角色:ISBNdb 否认实际提供服务,但其营销页面引发了外界对数据中介模式的担忧。
从 Anthropic 案例看:买书训练模型并非首次曝光
这一模式并不是第一次进入公众视野。来源提到,今年 1 月公开的一份法庭文件披露,Anthropic 内部曾存在代号为“Project Panama”的项目,目标是尽可能购买大量图书,完成数字化扫描后再销毁实体书。随后,Anthropic 与作者达成了一项总额 15 亿美元的和解协议。
值得注意的是,后续公开的法庭文件显示,相关做法本身被认为是合法的,真正令公司担忧的是负面舆论。换言之,在 AI 训练数据问题上,法律边界、商业策略和公众伦理认知之间存在明显张力。即便某种流程在合规层面可被辩护,当它涉及珍稀书籍被破坏时,也很容易触发公众对文化资源流失的反感。
为什么 AI 公司盯上纸质书
对于大模型训练而言,数据质量正在变得比单纯数据规模更重要。开放互联网中充斥着重复、低质、营销化和机器生成内容,随着 AI 内容不断回流网络,模型训练还可能出现所谓“负反馈循环”:模型用 AI 生成内容继续训练,最终导致质量下降、风格趋同甚至错误累积。因此,出版社、影视公司、图书馆、档案库等拥有高质量内容的机构,正逐渐成为 AI 公司关注的数据来源。
来源还提到,今年夏天,电影公司 A24 宣布与谷歌合作,为 DeepMind 提供训练素材,目标是帮助媒体生成模型摆脱大量低质量、风格混乱的 AI 内容。这说明,AI 企业获取高质量数据的路径正在从“抓取公开网络”转向“与内容持有方合作”或“采购实体内容”。图书之所以特殊,是因为它们不仅有知识密度,还承载着版本、编辑和出版链条中的专业筛选。
影响与解读:AI 数据焦虑正在外溢到现实世界
从技术角度看,破坏性扫描并非唯一选择。图书数字化可以通过非破坏式扫描完成,但如果流程追求低成本和高效率,拆掉书脊、平铺扫描会更容易获得清晰页面,之后受损书籍往往只能按废纸处理。报道称,这可能是实体书被销毁的主要原因,而非为了掩盖痕迹或垄断稀有知识。
对中文读者而言,这场争议的意义不只在于“AI 公司是否买了书”。它揭示了大模型产业进入下一阶段后的核心矛盾:当公开网络数据红利接近枯竭,企业会更积极地寻找高质量、低噪声、可解释来源的数据;但这些数据往往对应真实的文化资产、版权关系和公共情感。未来,围绕训练数据的竞争,可能不再只是网页抓取与授权之争,也会延伸到图书库存、影像素材、专业数据库和档案资源的利用边界。
ISBNdb 删除页面并不能终结争议。真正需要回答的问题是:在 AI 模型训练需求持续扩张的背景下,行业是否能建立更透明的采购、扫描、授权和保存机制,避免用短期效率换取不可逆的文化损失。对于模型公司来说,数据来源的声誉风险已经成为技术路线之外不可忽视的成本。