AirTag 追踪揭示亚马逊纸质书扫描流程:切除书脊后用于 Nova 模型训练
据 IT之家 8 月 17 日消息,外媒 404 Media 公布的一项追踪调查显示,亚马逊正在大批采购纸质书籍,并将书籍扫描后的内容用于 AI 训练。调查人员将苹果 AirTag 藏入一批珍贵书籍的货件中,追踪其在美国境内的流向,最终发现这批书抵达亚马逊位于拉斯维加斯的一座仓库。来源称,该仓库内有一支名为 VGT3 的团队,员工表示,为了提高扫描效率,他们会先切掉书脊,这意味着原书会在数字化过程中被直接毁掉。
根据报道,亚马逊随后会把扫描得到的数据用于训练其 Nova 模型。亚马逊发言人回应称,公司通过正常商业渠道采购书籍,用于改进产品。对于 AI 行业而言,这一事件再次把“模型训练数据从哪里来、以什么方式获得、是否会损害公共知识存量”等问题推到台前。
从网页数据到纸质书:AI 训练语料的来源正在扩展
过去,大模型训练数据常被外界理解为来自公开网页、代码仓库、论文、论坛和开放数据集。但随着高质量公开文本逐渐被重复使用,纸质书重新成为 AI 公司眼中的重要数据来源。来源摘要提到,一些书商怀疑,AI 公司可能正在尝试按照 ISBN 编号,系统性地扫描已经出版过的书籍。
纸质书的吸引力在于两点:其一,很多内容从未出现在互联网中,无法通过普通网页抓取获得;其二,大量书籍出版于 2022 年以前,通常不包含 AI 生成文本。对于希望提升模型语言质量、知识密度和长文本理解能力的公司来说,这类语料具有明显价值。尤其在当前模型竞争进入“数据质量”阶段后,高质量、低污染、结构完整的出版物可能比普通网页内容更具训练价值。
- 获取方式:来源显示,亚马逊通过商业渠道采购纸质书籍。
- 处理流程:为提升扫描效率,员工称会先切除书脊,再进行数字化。
- 用途指向:扫描后的数据据称会用于训练亚马逊 Nova 模型。
- 核心争议:原书被销毁后,知识进入企业私有模型,而非继续留在公共流通体系。
不只是亚马逊:行业已有类似“毁书扫描”案例
来源还提到,采用类似方式的并不只有亚马逊。Anthropic 此前也曾进行过相关项目。图书作者提起的一起诉讼披露了 Anthropic 内部的“巴拿马计划”:公司从电商平台购入书籍,切除书脊,再将内容数字化。
该案审理法官裁定,这类扫描属于合理使用,不构成版权侵权。裁决的一个依据是纸质原件已经被销毁,因此不存在把原书复制后再出售的情况。也就是说,在这一具体司法判断中,企业购买书籍、破坏原件并用于模型训练,与传统意义上的盗版复制和二次销售被区分开来。
不过,法律层面的暂时可行,并不意味着产业争议就此消失。对于作者、出版商、图书馆和读者来说,问题不仅是“是否侵权”,还包括“是否应当允许稀缺纸本被转化为封闭模型资产”。当书籍被扫描后销毁,纸质原件无法再进入二手市场、图书馆馆藏或研究者手中,公共可访问性可能随之下降。
影响解读:AI 数据竞赛正在改变知识的流通形态
这起 AirTag 追踪事件的特殊之处在于,它把原本隐藏在企业数据供应链中的流程具体化了:AI 公司并非只是在互联网上抓取信息,也可能在线下批量购买实体书,再通过工业化扫描把纸质知识转入模型训练系统。对中文读者而言,这提醒我们观察大模型竞争时,不能只看参数规模、推理速度和产品体验,还要关注背后的数据获取方式。
从产业角度看,出版物数据会继续成为模型公司的重要资源。未来,围绕授权采购、数字化存档、作者收益分配、公共馆藏保护等议题,AI 公司、出版行业和监管机构之间可能出现更多博弈。如果珍贵书籍只是被转化为某家公司的私有训练材料,而原件随之消失,那么 AI 技术进步与公共知识保存之间的矛盾会更加突出。
亚马逊此次被关注的并非单一仓库操作,而是大模型时代数据生产链条的一种缩影:当模型越来越依赖高质量文本,书籍从文化商品变成训练资源,知识的价值评估方式也在发生变化。对 AI 行业而言,如何在提升模型能力的同时,建立更透明、更可持续的数据使用机制,将成为接下来无法回避的问题。