人工智能

阿里云发布灵骏真武 M890:公共云首次开放超节点 AI 算力,面向十万亿参数 MoE 推理

2026年7月19日 · admin
openmagic ad

据 IT之家 7 月 18 日消息,在 2026 世界人工智能大会(WAIC)期间,阿里云正式发布灵骏真武 M890 超节点实例。这是阿里云首次通过公共云形态对外提供“超节点”级 AI 算力服务,目前已在内蒙古乌兰察布地域开放邀测。来源显示,M890 面向大模型训练与推理场景,支持 FP8/FP4 低精度计算,并通过自研 ICN Switch 1.0 芯片将 Scale-up 互联规模从 16 卡提升至 64 卡,卡间互联带宽提升至 800GB/s。官方称,凭借更大显存与全对称高速互联,单台超节点实例即可承载十万亿参数级 MoE 大模型推理

公共云上的“超节点”意味着什么

在大模型基础设施中,“超节点”通常指将多张加速卡通过高速互联组成一个更接近单一计算资源池的形态。相比传统多机多卡集群,超节点更强调节点内部的高带宽、低延迟与对称互联能力,目标是降低大模型在训练和推理过程中因跨卡通信带来的性能损耗。

此次灵骏真武 M890 的一个关键信息,是阿里云将这类超节点能力放到公共云上开放邀测。对于企业和开发者来说,这意味着不一定需要自建复杂的超大规模 GPU/AI 加速集群,也有机会通过云服务方式获得更高规格的模型训练与推理资源。尤其在 MoE 大模型场景中,模型参数规模持续膨胀,但每次推理只激活部分专家网络,对显存容量、卡间通信和调度效率都提出了更高要求。

来源显示,M890 支持 FP8/FP4 低精度计算。低精度计算已成为大模型训练和推理优化的重要方向之一,可以在满足一定精度要求的前提下提升吞吐并降低资源消耗。结合 64 卡 Scale-up 互联和 800GB/s 卡间互联能力,M890 更适合需要在节点内完成大量参数访问、专家路由与并行计算的模型工作负载。

训练性能提升与推理承载能力

阿里云方面表示,在智能驾驶、具身智能等训练场景中,灵骏真武 M890 相比上一代真武 810E,训练性能提升三倍。智能驾驶和具身智能通常涉及多模态数据、仿真环境、时序决策与大规模模型训练,对算力平台的持续吞吐、通信效率和存储读写能力要求较高。

更值得关注的是,M890 被定位为训推一体的高端算力实例。来源摘要提到,凭借超大显存与全对称高速互联,一台超节点实例可承载十万亿参数级 MoE 大模型推理。这对于正在探索超大 MoE 架构的模型厂商和行业客户来说,可能降低复杂部署门槛:过去需要跨越多个节点进行切分和通信的推理任务,有机会在更紧凑的超节点形态内完成,从而减少跨节点通信开销与系统调优复杂度。

  • 互联规模升级:通过 ICN Switch 1.0 芯片,Scale-up 互联规模由 16 卡提升至 64 卡。
  • 卡间带宽提升:卡间互联能力提升至 800GB/s,面向大模型并行计算与推理通信。
  • 低精度计算支持:支持 FP8/FP4,有利于提升训练、推理吞吐效率。
  • 面向超大模型:官方称单台实例可承载十万亿参数级 MoE 大模型推理。

网络与存储成为大模型算力竞争焦点

除了单个超节点实例,阿里云此次还强调了其智算基础设施的集群扩展能力。来源显示,依托 HPN 8.0 训推一体高性能网络架构,智算灵骏单集群最高支持 13 万卡异构算力混布,并支持 PD 分离部署需求,后续还可进一步扩展至百万卡级。

这里的“PD 分离”通常与大模型推理架构优化相关,即将不同阶段或不同类型的推理负载进行拆分部署,以提升资源利用率和服务效率。对于在线推理服务来说,如何在高并发、低延迟和成本控制之间取得平衡,已成为模型落地的关键工程问题。

可靠性方面,官方提到通过实例故障主动监控、分钟级故障自恢复以及 99.7% 的平均可用性,让算力更多用于训练本身。对于长周期大模型训练而言,集群故障不仅会拖慢进度,还可能造成检查点回滚、资源浪费和排障成本上升。因此,故障检测与自动恢复能力正在成为智算云服务的重要竞争指标。

前端网络方面,M890 相关基础设施使用 CIPU 2.0,以增强稳定性和安全能力,并加速数据传输与存储访问。存储侧,阿里云基于飞天盘古对高性能并行文件存储 CPFS 进行全栈重构,采用数据面与控制面分离、原生水平扩展设计。来源显示,单文件系统可支持百 PiB 容量、百 TB/s 吞吐与亿级 IOPS。

行业解读:云厂商争夺大模型基础设施入口

从产业角度看,灵骏真武 M890 的发布反映出云厂商正在把竞争重点从“有多少卡”推进到“如何组织和交付算力”。大模型企业并不只需要裸算力,还需要稳定的高速网络、可扩展存储、训练容错、推理部署工具链以及可按需获取的云服务形态。

对于中文 AI 产业用户而言,公共云超节点的意义在于:一方面,它可能让大模型公司、自动驾驶团队、机器人企业等更快尝试高规格算力;另一方面,也会推动模型架构与部署方式向更依赖高速互联和低精度计算的方向演进。随着 MoE、多模态模型和具身智能模型继续扩张,算力基础设施的工程能力将直接影响模型训练效率、推理成本和产品上线速度。

目前,灵骏真武 M890 已在内蒙古乌兰察布地域开放邀测。后续其在实际客户场景中的性能表现、可用性、成本模型以及与主流大模型训练框架的适配情况,将决定这类公共云超节点能否成为大规模 AI 应用落地的新基础设施选择。