Arm 在上海发布 CSS for Mobile 2:面向智能体 AI 的第二代移动计算平台
据来源显示,9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并发布第二代移动终端计算子系统 CSS for Mobile 2。这套平台面向智能体 AI 与 AI 原生图形场景,集成 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时把系统 IP、软件和开发者工具打包成更完整的移动计算方案。表面上看,它像是一次常规代际升级;但从 Arm 的表述看,CSS for Mobile 2 更像是在回答一个新问题:当手机上的 AI 不再只是聊天问答,而是能够理解意图、规划任务并调用应用完成流程时,底层计算平台该如何演进。
从单点算力到全流程协同
Arm 对智能体时代移动计算的判断,核心不只在“峰值性能”。来源摘要提到,Arm 将移动设备性能拆解为三个维度:任务各阶段的执行速度、数据在不同计算引擎之间的传输效率,以及系统对完整任务流程的协同调度能力。也就是说,智能体 AI 在手机上运行时,CPU、GPU、NPU、内存与互连系统不能再各自为战,而需要围绕端到端工作流进行优化。
CSS for Mobile 2 的平台化思路也延续了 Arm CSS 的一贯定位:把底层计算技术做成经过验证、可集成、可配置的基础模块。对芯片厂商而言,这意味着可以减少在底层 IP 整合、验证和物理实现上的重复投入,把更多资源放到自研加速器、内存架构、互连、系统软件和面向特定市场的差异化设计上。来源显示,该平台也保留了弹性,合作伙伴既可以整套采用,也可以与自研或第三方 IP 组合。
C2 CPU 集群:CPU 成为智能体流程的“编排引擎”
在智能体 AI 场景中,CPU 的角色正在发生变化。它不只是跑通用任务,还需要维护上下文、调度负载、协调模型与服务,并在手机功耗和散热约束内完成一整套流程。CSS for Mobile 2 搭载的新 C2 CPU 集群由 C2-Ultra、C2-Pro 和双 SME2 引擎组成,其中 C2-Ultra 被描述为 Arm 迄今最强的移动 CPU,C2-Pro 则偏向能效。
来源摘要给出的性能信息显示,新 CPU 集群面对最新 AI 模型时性能最高提升 1.7 倍,单线程性能提升 15%,相同性能下功耗最多降低 38%。在 Moonshine 和 Parakeet 语音转文本模型上,C2-Ultra 相比上一代 C1-Ultra 延迟降低 40%;记忆阶段的内存检索性能提升 41%;推理阶段小语言模型生成指令的平均速度提升 25%;端到端工作流性能提升 24%。其中,15% 来自 GeekBench 6.3 等通用基准,1.7 倍提升则与特定 AI 模型的矩阵运算吞吐有关,关键原因是这一代将 SME2 引擎从一颗增加到两颗,矩阵算力随之增强。
- 面向智能体流程:优化不只覆盖单个模型推理,而是覆盖语音识别、记忆检索、指令生成等连续阶段。
- 强调低延迟:CPU 更适合承担本地小语言模型、上下文维护和任务调度等对响应速度敏感的负载。
- 降低集成复杂度:平台化 CSS 可帮助合作伙伴更快完成 SoC 设计与验证,把精力转向差异化能力。
- 面向未来工艺:来源提到该平台可支持 2nm 等更前沿工艺节点,为后续扩展 SME2 单元留下空间。
影响解读:手机 AI 竞争不只是 NPU TOPS
过去几年,手机厂商和芯片公司常以 NPU TOPS 作为端侧 AI 的宣传重点。但 Arm 此次释放的信号是,智能体时代的竞争会更系统化。来源摘要中提到,Arm 高管认为,计算密度极高的负载更适合交给 GPU 或 NPU,而 CPU 的优势在于处理本地算力预算内的小语言模型,以及对延迟敏感的调度与编排任务。换言之,峰值算力并不能单独决定智能体体验,数据搬运、缓存体系、互连效率和系统调度同样关键。
这对移动 SoC 产业有两层意义。第一,芯片设计会从“堆单点算力”转向“优化完整 AI 工作流”,尤其是语音交互、上下文记忆、应用调用和多模型协作等场景。第二,Arm 通过 CSS for Mobile 2 把 CPU、GPU、互连、系统 IP 和工具链前置整合,实际上是在降低合作伙伴进入智能体 AI 手机芯片设计的门槛。对于终端厂商来说,未来差异化不只来自更高的跑分,也来自能否把端侧模型、系统软件和硬件调度真正打通。
总体来看,CSS for Mobile 2 不是单纯的移动 IP 升级,而是 Arm 对 AI 原生手机的一次平台级押注。随着智能体应用从演示走向日常使用,手机芯片需要在性能、功耗、延迟和开发效率之间重新平衡。Arm 的答案是:用可验证、可配置的底层平台承接复杂性,让生态伙伴把创新集中到更接近产品体验的地方。