第六代骁龙 8 超级至尊版端侧跑 30B MoE 模型:预填充吞吐超 330 Token/s
据 IT之家消息,在夏威夷时间 9 月 22 日 9 点、北京时间 9 月 23 日 3 点举行的 2026 骁龙峰会上,高通宣布与阶跃、无量火及江波龙合作,基于第六代骁龙 8 超级至尊版移动平台,完成阶跃 StepEdge-Omni 30B-MoE 模型的端侧适配与推理优化,并现场展示了相关智能体助手能力。来源显示,该模型拥有 300 亿参数,采用混合专家架构,可按任务需要激活部分专家模块,以降低计算量和内存带宽压力。测试数据方面,该方案预填充吞吐性能超过每秒 330 个 Token,解码吞吐性能超过每秒 28 个 Token。
30B MoE 模型上手机,关键在“只激活需要的部分”
大参数模型向移动端迁移,长期面临算力、内存、带宽和功耗的多重限制。此次高通与合作伙伴适配的 StepEdge-Omni 30B-MoE,并不是让 300 亿参数在每次推理时全部参与计算,而是依托 MoE,即混合专家架构,根据不同任务激活部分专家模块。
这种设计的核心意义在于:模型总体参数规模可以保持较高上限,但单次任务实际消耗的计算资源被压缩。对于手机这类空间、散热和能耗都受限的终端而言,MoE 架构为更大规模模型本地运行提供了一条现实路径。
来源摘要显示,合作方围绕推理引擎、异构调度及存储方案进行了优化,使模型运行内存需求较行业常规方案降低超过 50%,并支持在智能手机上稳定运行。这里的异构调度通常意味着将不同计算任务分配到更合适的硬件单元上,例如 CPU、GPU、NPU 等协同工作,从而提高整体效率。
本地智能体演示:邮件、行程与推荐不必依赖云端
高通表示,该方案无需调用云端服务,可以在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务。从应用形态看,这更接近“端侧智能体助手”,而不只是一个本地聊天机器人。
如果手机端模型能够直接理解邮件内容、提取日程信息并生成后续动作,意味着个人助理类应用有机会减少对云端模型的依赖。对于用户而言,潜在收益主要体现在响应延迟、隐私保护和离线可用性上;对于厂商而言,则意味着 AI 功能可以更深度地与系统应用、文件、日历、通信等场景结合。
此次披露的性能指标也值得关注。预填充吞吐超过每秒 330 个 Token,指模型在处理输入提示词阶段的速度,这关系到长文本、长邮件、复杂指令进入模型后的响应等待时间。解码吞吐超过每秒 28 个 Token,则更接近用户感知中的“生成速度”,影响回答、草稿、规划结果输出是否流畅。
- 模型规模:StepEdge-Omni 30B-MoE 拥有 300 亿参数。
- 运行方式:基于 MoE 架构,按任务激活部分专家模块。
- 优化方向:推理引擎、异构调度、存储方案协同优化。
- 性能数据:预填充吞吐超过 330 Token/s,解码吞吐超过 28 Token/s。
- 应用场景:本地处理邮件理解、行程规划、日历同步、航班酒店推荐等任务。
影响解读:端侧 AI 正从“小模型功能”走向“大模型智能体”
过去一段时间,手机 AI 多集中在影像增强、语音转写、摘要、翻译、抠图等单点功能。此次高通展示的方向则更进一步:将更大规模的 MoE 模型运行在手机上,并围绕智能体任务进行系统级适配。换句话说,端侧 AI 的竞争焦点,正在从“能不能跑模型”转向“能不能稳定、高效地完成多步骤任务”。
这对移动芯片、模型厂商和存储生态都是新挑战。芯片需要提供足够的 AI 推理能力和能效表现;模型需要为端侧约束重新设计;存储与内存方案也会影响大模型加载、缓存和上下文处理效率。江波龙出现在合作名单中,也说明端侧大模型并非只依赖算力,数据读写与存储优化同样关键。
从产业角度看,30B 级 MoE 模型在手机端稳定运行,有助于推动更低时延、更重隐私保护的智能体应用发展。尤其是邮件、日程、出行等任务本身涉及大量个人信息,本地执行能够减少敏感数据上传云端的必要性。
不过,这类方案距离大规模普及仍有变量。来源也提到,实际应用还取决于终端成本、功耗、模型可靠性以及用户接受度等因素。对于普通用户来说,端侧大模型不仅要“跑得起来”,还要在续航、发热、响应准确性和交互体验上达到可接受水平。
总体来看,高通此次与阶跃等合作展示的端侧 30B MoE 模型,是移动 AI 从演示功能迈向智能体体验的重要信号。随着手机芯片、模型压缩、推理引擎和存储系统继续协同优化,未来旗舰手机的 AI 能力可能不再只是云端模型的入口,而会成为真正具备本地理解、规划与执行能力的个人智能终端。