人工智能

天数智芯发布通用 GPU 旗舰天垓 300:面向大模型训练推理,已具备规模化应用条件

2026年7月20日 · admin
openmagic ad

据 IT之家 7 月 19 日消息,在 2026 世界人工智能大会期间,天数智芯发布新一代通用 GPU 旗舰产品天垓 300。来源显示,这款产品基于 SIMT 通用计算架构,面向大模型训练与推理中的多类型计算需求,可支持标量、矢量和张量等计算类型,并针对 Attention、MoE、AF 分离、PD 分离以及大规模系统扩展等方向进行了优化。天数智芯方面称,天垓 300 目前已具备规模化应用条件,并已与国内云厂商、服务器厂商、互联生态及超节点系统展开深度适配,可支撑从单机到集群的部署形态。

面向大模型核心负载优化:Attention、MoE 与 Decode 成重点

从此次披露的信息看,天垓 300 的定位并不只是传统意义上的通用计算 GPU,而是明显围绕当前大模型系统的关键瓶颈进行设计。来源摘要提到,该产品在 Attention、MoE、AF 分离、PD 分离和大规模系统扩展等方面进行了优化,这些方向都与大模型训练、推理效率以及集群可扩展性密切相关。

其中,Attention 是大语言模型处理上下文信息的核心计算环节,尤其在长上下文场景中,Attention 计算与访存压力会显著上升。天数智芯方面介绍,天垓 300 的Attention 效率超过 90%;在 64k 上下文场景下,Attention 效能高于 Hopper 方案 10%。这意味着在长序列任务中,相关优化有望帮助模型更充分地利用计算资源,从而提升训练与推理效率。

MoE(混合专家模型)则是近年来大模型架构中的重要路线之一,其特点是在推理或训练时根据输入激活部分专家网络,以在参数规模和计算成本之间取得平衡。来源显示,天垓 300 的 MoE 平均效能高于 Hopper 方案 10%。对于云端推理服务和多模型平台而言,如果同等算力投入下能够完成更多推理任务,将直接影响单位成本和服务吞吐。

  • 架构基础:基于 SIMT 通用计算架构,支持标量、矢量、张量等多类计算。
  • 长上下文优化:Attention 效率超过 90%,64k 上下文 Attention 效能高于 Hopper 方案 10%。
  • MoE 推理能力:MoE 平均效能高于 Hopper 方案 10%,有助于提升同等算力下的任务处理量。
  • 通信与延迟:首字延迟较 Hopper 架构方案降低约 20%,平均通信延迟降低约 13%。
  • 部署形态:已与国内云厂商、服务器厂商、互联生态和超节点系统进行适配,可支持单机到规模化集群部署。

降低首字延迟,瞄准 AI 推理体验与服务成本

在大模型推理服务中,用户感知最明显的指标之一是“首字延迟”,也就是从请求发出到模型开始输出首个 token 的等待时间。来源显示,天垓 300 的首字延迟较 Hopper 架构方案降低约 20%,Decode 效能较 Hopper 架构方案提升 10%。这类提升对于对话式 AI、代码助手、智能客服、Agent 工作流等交互场景具有现实意义。

相比训练阶段,推理阶段往往更强调持续吞吐、响应速度和单位请求成本。尤其在 Decode 阶段,大模型会逐 token 生成内容,多卡之间可能出现高频、小数据量通信。天数智芯方面称,天垓 300 面向 Decode 阶段的通信特点,降低协议开销,优化链路路径和数据流转机制,使平均通信延迟降低约 13%。

这也反映出 AI 芯片竞争的一个趋势:仅提升峰值算力已经不够,能否围绕真实模型结构、真实推理流程和真实集群通信进行系统级优化,正在成为衡量产品竞争力的重要维度。对于云计算平台和企业私有化部署场景而言,低延迟和高吞吐往往比单一理论指标更接近实际采购决策。

影响与解读:国产 AI 算力从单卡性能走向系统适配

天数智芯此次强调“具备规模化应用条件”,值得关注。AI 芯片能否进入实际生产环境,并不只取决于芯片本身的指标,还需要服务器、网络互联、软件栈、模型框架、调度平台和应用生态共同配合。来源显示,天垓 300 已与国内云厂商、服务器厂商、互联生态及超节点系统开展深度适配,这说明其目标是进入更大规模的 AI 基础设施部署场景。

对国内 AI 产业来说,大模型训练和推理需求正在持续增长,算力供给的稳定性、成本结构和生态可用性都变得更加关键。天垓 300 针对 Attention、MoE、Decode 通信等环节进行优化,方向上契合了当前大模型从“参数规模竞争”转向“效率与部署能力竞争”的变化。

不过,芯片产品从发布到大规模落地仍需要经过模型适配、业务验证、集群稳定性测试和开发者生态建设等环节。尤其对于通用 GPU 而言,软件工具链、框架兼容性和运维可观测能力,会直接影响云厂商和企业客户的采用速度。后续天垓 300 在实际云服务、服务器整机以及集群方案中的表现,将是判断其规模化应用成色的关键。

总体来看,天数智芯发布天垓 300,释放出国产 AI 算力厂商继续向大模型核心场景深入的信号。从单卡计算能力,到长上下文、MoE、Decode 延迟和多卡通信优化,再到与云和服务器生态适配,AI 芯片竞争正在进入更系统化的阶段。