人工智能

汤森路透公布首款大语言模型 Thomson:基于阿里千问,研发投入约 4000 万美元

2026年8月25日 · admin
openmagic ad

据 IT之家 8 月 24 日消息,路透社母公司汤森路透集团近日正式公布其首款大语言模型 Thomson。来源显示,这一模型基于阿里巴巴千问系列构建,目前使用的基础版本为 Qwen3.5-397B。汤森路透称,Thomson 已达到全球顶级 AI 模型水平,其整体研发成本约为 4000 万美元;此前外界流传的 45 万美元数字,仅对应最后一次训练成本,并不能代表完整投入。

这则消息的看点不只在于一家信息服务巨头推出自有模型,更在于其技术路线:汤森路透没有直接依赖 OpenAI、Anthropic 等美国闭源模型,而是选择以开源或可定制基础模型为底座,围绕法律、资讯、文档审查等专业场景进行再训练和强化。这反映出大型内容与专业服务公司正在从“调用通用模型”转向“打造可控的行业模型”。

从千问底座到专业模型:Thomson 如何训练

根据来源介绍,Thomson 的基础模型源自阿里巴巴千问,现阶段采用 Qwen3.5-397B。汤森路透首先与帝国理工学院合作,对基础模型进行重新训练,使其更符合安全、伦理和政治中立性等要求。随后,公司再使用自有内容进行预训练、后训练,并在内部环境中进行强化学习。

这一流程说明,Thomson 并不是简单套壳通用模型,而是在通用大模型能力之上叠加了专业语料、合规要求和内部反馈机制。对于汤森路透这样的机构而言,自有内容资产本身就是核心竞争力。将这些内容转化为模型能力,可以让 AI 更贴近法律研究、文档审查、资讯检索和企业知识处理等高价值场景。

  • 基础模型:来源显示为阿里巴巴千问,当前版本为 Qwen3.5-397B。
  • 训练路径:先进行安全、伦理和中立性重训,再结合自有内容做预训练、后训练和强化学习。
  • 成本口径:整体研发成本约 4000 万美元,45 万美元仅为最后一次训练成本。
  • 应用方向:更适合文档审查、法律相关任务和专业内容处理等场景。

性能对比:法律基准表现接近头部模型

汤森路透称 Thomson 已跻身全球最佳 AI 模型之列。来源提到,在 Stanford LegalBench 测试中,Thomson 得分为 0.823,落后于 Gemini 3.1 Pro 和 GPT-5.5。在 Harvey Legal Agent Benchmark 中,Thomson 的表现仅略低于 Opus 4.8。

不过,相关测试也存在需要注意的比较条件。来源显示,Thomson 在测试时使用了推理阶段扩展,而 GPT-5.5 则是在没有开启推理模式的情况下参与测试。这意味着部分榜单结果不能简单理解为“同等条件下的绝对排名”。在深度搜索测试中,Thomson 得分为 0.53,而 GPT 5.4 为 0.65,说明其在复杂检索与深度搜索能力上仍有提升空间。

影响与解读:行业模型正在走向“可控成本 + 高度定制”

汤森路透强调,不采用 OpenAI、Anthropic 等美国闭源模型,主要原因是外部模型长期成本较高,并且难以进行高自由度调整。对于专业服务公司来说,模型调用费用只是成本的一部分,更关键的是能否控制数据、流程、模型行为和业务适配节奏。

这也是 Thomson 对行业的启示:未来并非所有企业都要训练最大参数、最通用的模型。相反,围绕具体任务构建小规模但高度可调的自研模型,可能更符合商业落地需求。尤其在法律、金融、媒体、企业知识管理等领域,准确性、可解释性、权限控制和合规性往往比通用聊天能力更重要。

从中文科技产业视角看,Thomson 选择基于千问构建,也说明中国开源模型生态正在进入更多国际专业场景。对阿里千问等基础模型而言,能被全球信息服务巨头用于行业模型开发,是其工程能力、可定制性和生态影响力的一次展示。随着更多机构基于开源底座开发垂直模型,AI 竞争的重点也将从单一模型参数竞赛,进一步转向数据资产、训练流程、行业评测和应用闭环。