人工智能

AI 公司转向大规模收购二手书:为模型寻找未被“AI 垃圾”污染的训练语料

2026年7月29日 · admin
openmagic ad

据 IT之家 7 月 28 日援引 404 Media 调查报道,多家 AI 公司正通过中间商大批量采购二手纸质图书,用于获取更高质量的模型训练数据。来源显示,这类采购可能覆盖从单次上千本到上百万本不等的订单,且买家对题材、作者和价格并不敏感。随着互联网上 AI 生成内容快速增加,模型厂商正在重新把目光投向 2022 年以前出版的纸质书,因为这类内容更可能由人类创作,受到生成式 AI 内容污染的概率更低。

这起报道揭示了 AI 产业在算力、内存和存储之外的另一种资源竞争:高质量、可规模化、可数字化的人类文本。对大模型来说,数据并非越多越好,低质量重复内容会削弱训练效果,而书籍长期以来被视为结构完整、编辑质量较高、知识密度更高的语料来源。

为什么旧书突然变成 AI 训练资源

生成式 AI 的快速普及,让互联网内容生态发生变化。大量自动生成的低质文章、改写文本和重复内容进入公开网页,形成所谓“AI 垃圾内容”。如果新一代模型继续大量学习这些内容,可能会带来质量退化、事实混乱和表达同质化等问题。

因此,AI 公司开始寻找更“干净”的语料。来源称,2022 年前出版的纸质书尤其受到关注,因为它们大多诞生在生成式 AI 大规模普及之前,内容来源相对清晰,且经过作者、编辑、出版社等多层筛选。对于训练通用大模型、文学写作模型、推理模型和专业知识模型而言,这些书籍都具备较高价值。

  • 内容质量较高:纸质书通常经过编辑和出版流程,文本完整性好。
  • AI 污染较少:早期出版物更可能是人类原创内容。
  • 覆盖领域广:小说、教材、专业书、工具书等均可补充模型知识面。
  • 便于索引采购:带 ISBN 的书籍可通过全球统一编码进行批量识别和交易。

采购模式出现异常:不挑主题、不计价格、只看规模

报道称,拥有大量图书目录信息的 ISBNdb 已开始面向 AI 企业推出大规模图书采购服务。该数据库收录超过 1.11 亿本图书目录信息,过去主要服务书商、图书馆和发行商,如今则在 AI 数据需求推动下调整业务方向。

一些职业书商观察到,今年 4 月以来二手书销量出现显著增长。来源提到,有书商过去生意较好时一周约能卖出 20 本书,而最近几个月每周销量已增至数百本。Alibris、Biblio 等二手书平台上的其他卖家,也反馈出现类似大宗采购现象。

目前尚无确凿证据表明这些订单一定来自 ISBNdb 或某一家 AI 公司,但报道指出了几个异常特征:采购对象几乎都是带 ISBN 的图书;买家几乎没有主题、类别或作者偏好;部分图书即便价格明显高于市场水平,也会被直接买下。这种“按标识批量扫货”的方式,更像是为了建立训练语料库,而非传统收藏、教学或零售需求。

从扫描到销毁:版权与文化保存争议同步升温

AI 公司使用纸质图书训练模型并非首次引发关注。来源提到,Anthropic 曾投入数百万美元采购纸质图书,用于提取内容训练 Claude 模型,并从 Better World Books 大量采购。相关诉讼中还披露,Anthropic 曾聘请专业文档扫描公司进行数字化处理,其中包括 Datamation Information Services。

图书数字化通常有两类方式:一种是非破坏性扫描,通过俯拍、平板或 V 型设备在不拆书的情况下完成;另一种是破坏性扫描,即拆开书脊,将页面送入高速工业扫描仪。后者效率更高、成本更低,因此被认为更适合大规模处理,但代价是纸质书可能被永久拆毁。

在版权层面,法院曾认定将正版图书用于 AI 训练属于版权法中的“合理使用”,但 Anthropic 因长期保存包含 700 万本盗版图书的数据库,被判赔偿 15 亿美元。类似争议也延伸到谷歌,近期已有出版商联盟起诉谷歌,指控其未经授权使用数百万本受版权保护图书训练 Gemini 模型。

影响解读:数据竞争正在从互联网转向实体知识资产

这场二手书采购潮说明,大模型竞争已经不只是 GPU、推理成本和参数规模的竞争,也正在转向可控、高质量、低污染的数据资产竞争。对于领先 AI 公司而言,谁能合法、稳定、低成本地获取优质语料,谁就可能在模型质量和长期迭代上占据优势。

但问题在于,纸质书并不只是训练材料,也是公共文化记忆的一部分。若大量普通书、绝版书甚至珍贵版本被拆毁,而扫描后的内容只进入企业私有数据库,公众未必能获得相应的知识回流。换句话说,人们可能得到更强的 AI 助手,却失去一部分原本可流通、可收藏、可研究的实体知识资源。

对中文读者和国内 AI 行业而言,这一趋势同样值得关注。未来围绕训练数据的合规采购、版权授权、图书数字化标准和公共知识保存,可能会成为模型产业绕不开的基础议题。当“干净数据”变成稀缺资源,AI 公司如何获取、使用并回馈这些知识,将直接影响技术创新与社会信任之间的平衡。