马斯克称要求 SpaceXAI 非破坏性扫描珍稀图书,AI 训练数据获取方式再受关注
据 IT之家 7 月 29 日消息,围绕 AI 公司获取图书内容用于模型训练的争议仍在发酵。调查媒体 404 Media 此前报道称,一些人工智能公司正在大量收购稀缺图书,并通过切除书脊的高速扫描方式完成数字化,纸质原件随后被粉碎销毁。马斯克近日转发相关报道并表示,已要求 SpaceXAI 团队妥善保存图书馆中的所有珍稀图书,采用非破坏性扫描方式进行数字化,而不是直接切除书脊后扫描。
这一表态将 AI 训练数据背后的“物理成本”再次推到台前。过去,公众对大模型数据争议的关注点多集中在版权、授权和网络内容抓取上,但此次报道揭示的是另一条路径:AI 公司为了获得相对“干净”、结构稳定的文本来源,可能会转向实体图书市场,并以工业化流程将纸质书转成可用于训练的数据。
破坏性扫描为何会成为 AI 数据链条的一环
来源显示,破坏性扫描的流程通常会拆开书籍,切除书脊,再将单页送入高速工业扫描仪。这种方式的优势在于效率更高、成本更低,尤其适合大规模处理纸质资料。对于需要海量文本语料的大模型公司而言,这类流程可以快速将纸质内容转化为机器可处理的数字文本。
但问题也随之出现:一旦书籍被拆解并粉碎,纸质原件便无法恢复。对于普通流通图书而言,这可能更多是商业和版权层面的争议;但如果对象是珍稀图书、馆藏资料或难以再版的旧书,其损失就可能涉及文化保存与公共知识资源保护。
- 非破坏性扫描:通常使用俯拍扫描仪、平板扫描仪或 V 型扫描设备,不拆解书籍即可完成数字化。
- 破坏性扫描:通过切除书脊拆页扫描,速度快、成本较低,但会永久破坏纸质原件。
- AI 公司选择何种方式,反映的不只是技术效率,也涉及版权合规、文化资产保护和企业责任。
Anthropic 案例让版权与实体书处置问题交织
据报道,Anthropic 作为当前卷入版权诉讼的主要 AI 公司之一,曾投入数百万美元购买大量纸质图书,用于提取内容训练 Claude AI 模型,随后再将这些图书销毁。该信息使外界对大模型训练语料来源的讨论进一步扩大:如果企业购买了实体书,是否就拥有将内容用于模型训练的权利?购买后的销毁行为是否合规?这些问题仍有待法律和行业规则给出更清晰边界。
从技术角度看,图书内容对于大模型具有吸引力并不意外。相比开放网页,经过编辑和出版流程的图书通常更系统、更稳定,也较少受到垃圾信息和重复内容污染。因此,实体书可能被视为一种高质量文本来源。但从产业治理角度看,数据质量不能成为绕开版权授权、破坏实体馆藏或损害公共文化资源的理由。
影响解读:大模型竞争正在进入“数据治理”阶段
马斯克关于 SpaceXAI 扫描方式的表态,至少释放出一个信号:在模型能力竞争之外,AI 公司正在被迫面对训练数据获取方式的社会影响。早期大模型竞争强调算力、参数规模和产品速度,如今围绕数据来源、授权方式、资料保存和透明度的审视正在加强。
对中文读者和国内 AI 行业而言,这一事件也有借鉴意义。未来高质量语料的获取不太可能只依赖“能不能抓到”或“能不能买到”,更需要回答“是否获得授权”“是否保留原件”“是否可追溯”“是否尊重文化资产”等问题。尤其是在图书馆、档案馆、古籍和绝版书等场景中,数字化本身是有价值的,但前提应当是保护原件,而不是以训练效率为唯一目标。
总体来看,非破坏性扫描并不能直接解决所有版权争议,但它至少在实体保护层面提供了更负责任的选择。随着 AI 公司对优质语料的需求持续增长,围绕图书数字化、模型训练和知识产权的规则博弈仍将持续,行业也需要在效率与合规、创新与保存之间找到更稳妥的平衡。