微软与 OpenAI 版权案再曝内部材料:AI 训练被内部高管称为“大规模劳动窃取”
据 IT之家援引 Tom’s Hardware 报道,在《纽约时报》起诉微软与 OpenAI 的版权纠纷案中,原告近日已向法院申请简易判决,并提交新的法律摘要,披露了更多来自两家公司内部的文件和沟通内容。该案可追溯至 2023 年年底,《纽约时报》指控微软和 OpenAI 未经许可使用其大量新闻报道训练 ChatGPT、Copilot 等 AI 产品。此次新增材料的核心看点在于:部分微软与 OpenAI 内部人士早已意识到,生成式 AI 对内容创作者和出版商可能造成重大冲击。
内部备忘录显示:AI 训练争议并非外界单方面质疑
来源显示,《纽约时报》提交的法律摘要引用了微软应用科学总监 Brent Hecht 于 2023 年 1 月撰写的一份内部备忘录。备忘录中据称提到,全球数百万人很快会认为,大型模型“吞噬”他们的劳动成果是一种前所未有的盗窃,并将其形容为“人类历史上规模最大的劳动成果盗窃”。
另一份微软文件也被引用称,几乎没有人希望自己创作的内容被以这种方式使用,也没有因此获得补偿。这类内部表述之所以引发关注,是因为它不仅来自版权方或媒体行业的外部批评,而是出现在 AI 产品主要推动者之一的公司内部讨论中。
《纽约时报》方面申请的是美国民事诉讼中的简易判决程序。简单来说,申请方主张案件不存在影响裁判结果的重大事实争议,因此无需完整庭审即可依据现有证据裁定。不过,法院仍可能批准、驳回或部分批准该申请,获批也不意味着所有关联争议都会立即结束。
从训练数据到流量替代,出版商担忧进一步扩大
这起案件并不只围绕“模型训练是否侵权”展开,也涉及 AI 产品上线后对新闻网站流量和商业模式的影响。来源称,随着 ChatGPT 在 2023 年迅速走红,微软自身数据显示,与 Bing 搜索相比,Copilot 可能导致《纽约时报》的点击率最高下降 93%。
微软应用科学总监的另一份备忘录据称将这种情况称作“恶性循环”,并认为这会同时损害模型性能和整个互联网。相关表述指出,最终产品威胁到关键供应商的经济基础,在内容供应链层面形成了罕见局面。
从科技产业角度看,这正触及生成式 AI 的核心矛盾:模型需要高质量语料来训练和更新,但如果 AI 回答直接替代用户点击原始内容,内容生产者的收入和持续供给能力就会受到冲击。长期看,如果优质内容生产体系被削弱,AI 模型本身也可能面临数据质量下降的问题。
- 争议焦点之一是:未经许可使用新闻内容训练大模型是否构成侵权。
- 另一个焦点是:AI 摘要和问答是否会替代搜索点击,削弱出版商收入。
- 内部材料显示,微软与 OpenAI 内部人员曾讨论过出版商面临的生存压力。
- 法院是否支持简易判决,将影响案件走向,但不一定终结全部争议。
影响解读:AI 公司与内容行业的授权规则或被迫重塑
来源还提到,OpenAI ChatGPT 负责人 Nick Turley 在内部沟通中表示,AI 聊天机器人对出版商构成“生存威胁”,因为它们在很大程度上具有替代性,且随着技术进步替代性会更强。另一位 OpenAI 工程师则表示,无论链接展示得多醒目,用户都不会点击。另有材料称,一名 OpenAI 研究员曾向公司总裁 Greg Brockman 提到绕过《纽约时报》付费墙的技巧,后者作出回应。
这些内容如果在诉讼中被法院采纳,可能会强化原告关于“被告明知风险仍继续使用内容”的论证。对整个 AI 行业而言,此案的意义不只在微软、OpenAI 与《纽约时报》之间。它可能影响未来大模型训练数据的授权方式、出版商与 AI 平台的分成机制,以及搜索、浏览器、办公软件中 AI 摘要功能的边界。
对于中文读者和国内 AI 产业观察者来说,这一案件提醒我们:大模型竞争不只是算力、算法和产品体验之争,也正在进入数据来源、版权合规与内容生态可持续性的深水区。未来,AI 公司如果想持续获得高质量内容,很可能需要更清晰的授权、标注、引用和收益回流机制。否则,技术越能替代阅读入口,围绕内容价值分配的冲突就越难避免。