英伟达开源 Nemotron-Labs-TwoTower:双塔扩散语言模型将 Token 生成吞吐提升至 2.42 倍
据 IT之家 7 月 3 日消息,英伟达在 7 月 2 日发布博文,宣布推出 Nemotron-Labs-TwoTower。这是一种基于预训练自回归骨干网络的离散扩散语言模型,核心目标是缓解大模型在 Token 生成环节的速度瓶颈。来源显示,该模型已以开源权重形式发布在 Hugging Face 平台,采用 NVIDIA Nemotron Open Model License 授权。对于关注大模型推理效率、Agent 响应速度和 AI 应用成本的开发者来说,TwoTower 的看点不只是“更快”,而是尝试用新的生成架构在质量与吞吐之间重新找平衡。
双塔架构:把上下文建模和去噪生成拆开
Nemotron-Labs-TwoTower 总参数规模为 60B,采用双塔(TwoTower)架构:其中一部分是 30B 的自回归模型,也被称为 AR / context Tower;另一部分是 30B 的扩散 / 降噪 Tower。来源摘要显示,每个 Tower 激活 3B 模型,并包含 128 个可路由专家。
传统自回归语言模型通常按顺序逐个生成 Token,这种方式质量稳定,但在长文本、代码、复杂推理或多轮对话场景下,生成速度容易成为体验瓶颈。TwoTower 的思路则是把传统扩散语言模型中的网络任务拆分:上下文塔负责维护文本的自回归上下文,并保持冻结;去噪器塔经过训练,负责对噪声块进行去噪。两个塔之间通过逐层交叉注意力连接协同工作。
这意味着,模型并不是简单替换掉自回归机制,而是在保留上下文表达能力的同时,将生成过程中的部分任务交给扩散式去噪模块处理。对于大模型工程来说,这类结构的价值在于:它试图减少纯自回归逐 Token 解码带来的吞吐限制,同时避免完全牺牲已有预训练模型的语言能力。
性能表现:保留 98.7% 质量,吞吐提升 2.42 倍
英伟达表示,从综合基准测试质量来看,TwoTower 双塔架构保留了 98.7% 的质量表现,而实际运行时间吞吐量提升至自回归基线的 2.42 倍。来源对比的自回归基线为 Nemotron-3-Nano-30B-A3B(AR)。
在具体基准上,TwoTower 在部分任务中与 AR 基线非常接近。例如 MMLU 为 78.24,基线为 78.56;WinoGrande 和 RACE 的结果与基线一致;ARC-Challenge 上 TwoTower 还高于 AR 基线。不过在 HumanEval、GSM8K、MATH-500 等代码与数学推理相关测试中,TwoTower 相比基线存在一定差距。
- 质量保留:综合指标显示 TwoTower 保留 98.7% 的基线质量。
- 吞吐提升:生成吞吐达到自回归模型的 2.42 倍。
- 架构特点:上下文塔冻结,去噪塔训练,二者通过逐层交叉注意力协作。
- 开源形式:模型权重已在 Hugging Face 发布,授权为 NVIDIA Nemotron Open Model License。
影响解读:推理效率竞争正在进入架构层
过去一年,大模型应用的竞争焦点从“参数规模”逐渐转向“推理效率”和“单位成本”。在企业知识库、智能客服、代码助手、办公自动化和多 Agent 工作流中,用户感知最明显的指标往往不是某个榜单分数,而是响应是否足够快、长任务是否稳定、并发成本是否可控。
TwoTower 的发布说明,英伟达正在从硬件、推理框架之外,进一步把优化延伸到模型结构本身。相比单纯依赖更强 GPU 或推理加速库,架构改造有机会在模型生成机制上释放吞吐空间。若后续开发者能够在真实应用中复现类似收益,扩散语言模型可能会成为提升 LLM 生成速度的一条重要路线。
不过也需要看到,来源给出的测试显示,TwoTower 并非在所有任务上都等同或优于自回归模型。尤其在代码生成、数学与复杂推理任务中,质量差距仍值得关注。对于实际落地而言,这类模型更可能先在对响应速度要求高、对极限推理精度要求相对可控的场景中试水,例如高并发问答、内容草拟、批量摘要、轻量 Agent 调度等。
总体来看,Nemotron-Labs-TwoTower 的意义不只是一次模型开源,而是英伟达对“大模型生成范式”的一次公开实验:在保持接近原有质量的前提下,用双塔扩散结构换取更高吞吐。对中文 AI 开发者和企业用户来说,接下来更值得关注的是其在真实部署环境中的延迟、显存占用、并发能力以及与现有推理栈的兼容性。