摩尔线程王东谈 AI 推理市场:没有“万能芯片”,软硬协同将成关键
据 IT之家 7 月 18 日援引财联社报道,GPU 厂商摩尔线程联合创始人、执行总裁王东近日谈及大模型与 AI 推理市场时表示,当前大模型在国内外迭代速度都很快,头部厂商平均约每两个月完成一次前沿基础模型版本更新。同时,在模型调用成本方面,中国前沿基础模型相较海外同等智力水平模型呈现出更明显的成本优势。围绕推理芯片选择,他强调,推理市场并不存在一颗可以适配所有场景的“万能芯片”,更现实的方向是由硬件、软件、模型与服务共同组成的解决方案组合。
这一判断反映出 AI 产业从“拼训练算力”走向“拼推理效率”的阶段性变化。随着大模型进入更多应用场景,企业关注点不再只是模型参数规模和训练能力,而是如何在可控成本下完成稳定、低延迟、高并发的推理服务。对于国内 GPU 厂商、MaaS 服务商以及行业客户来说,推理市场的竞争正在变得更细分,也更依赖系统级能力。
大模型迭代加速,成本效率成为中国模型的重要优势
王东提到,国内外大模型发展非常迅速,头部厂商保持了较高频率的版本迭代。模型快速更新背后,是算法、数据、训练基础设施和产品化能力的持续投入。值得注意的是,他特别指出,中国前沿基础模型在与国外同等智力水平模型相比时,调用成本具有明显优势,整体性价比更优。
从产业角度看,这意味着中国模型公司在算力资源并不无限充裕的情况下,持续围绕模型效率、价格效率和训练成本做优化。对中文科技产业而言,这一点很关键:如果模型能力接近,但调用价格更低,就会降低企业试用和部署 AI 应用的门槛,推动智能客服、办公自动化、内容生成、代码辅助、行业知识库等场景更快落地。
不过,模型成本下降并不只取决于模型公司本身。推理侧的硬件适配、编译优化、算子支持、并行策略、显存管理和服务调度,都会影响最终调用成本。因此,AI 基础设施的竞争正在从单点硬件参数,转向模型、芯片、框架和服务平台的综合效率。
推理市场碎片化:为什么没有“万能芯片”
王东认为,推理市场技术应用门槛相对较低,但场景高度碎片化,不存在任何一家公司能够垄断所有细分应用场景。他指出,不存在绝对完美的单一硬件,只有通过灵活的软硬协同,才能让不同模型找到最适合自己的硬件组合,在成本与性能之间取得平衡。
这与当前 AI 应用落地的实际情况相符。不同企业对推理的需求差异很大:有的重视响应速度,有的更关注吞吐量,有的需要处理超长上下文,有的则要部署在私有环境或边缘设备中。即便都是大语言模型,参数规模、精度格式、上下文长度、并发压力、业务峰值和数据安全要求不同,也会带来完全不同的硬件选择。
因此,“万能芯片”很难成立。训练场景通常更追求大规模集群能力和高速互联,而推理场景则可能更看重单位成本、能耗、显存容量、软件栈成熟度以及特定模型的优化效果。未来企业采购 AI 算力时,可能不会只问某张卡的峰值算力,而会更关注“在我的模型和业务负载下,每次调用成本是多少”。
- 模型类型不同:语言、多模态、图像生成、代码模型对算子和显存需求并不一致。
- 部署位置不同:云端、私有化机房、边缘侧和终端设备对功耗、空间与运维要求不同。
- 业务指标不同:低延迟、高吞吐、低成本、高稳定性往往需要不同的系统取舍。
- 软件适配不同:框架、推理引擎、编译器和算子库成熟度会直接影响硬件可用性。
影响解读:ISP 与 MaaS 生态或迎来新分工
王东还判断,市场将出现大量 ISP 公司,为 MaaS 提供商或终端客户提供更具性价比、更灵活的定制化推理服务。这里的核心变化在于,AI 推理不再只是“买卡部署模型”这么简单,而会形成更细的服务分工:底层芯片厂商提供硬件与软件栈,中间服务商完成模型适配、推理优化和资源调度,上层客户按业务需要购买可用能力。
对于 MaaS 提供商而言,推理成本直接影响 API 价格和毛利空间。谁能在同等效果下把推理成本压低,谁就更容易获得开发者和企业客户。对于终端客户而言,定制化推理服务可以减少自建团队的技术门槛,尤其适合需要私有化部署、行业模型微调或特定场景高并发调用的企业。
这也给国产 GPU 带来新的机会。过去外界评估 GPU 厂商时,容易集中在单卡峰值算力、生态兼容度和训练能力上;而在推理市场中,如果国产 GPU 能围绕特定模型、特定行业负载实现更好的性价比,就可能在碎片化市场中找到更多切入点。换言之,国产 AI 芯片的竞争未必只是在一个通用排行榜上分胜负,而是在大量真实业务场景中证明可部署、可优化、可规模交付。
摩尔线程业绩与产品进展:AI GPU 需求仍处高景气
来源显示,被称为“国产 GPU 第一股”的摩尔线程已于去年 12 月登陆科创板。其 2026 年半年度业绩预告显示,公司营业收入区间为 16.5 亿元至 17.5 亿元,同比增长 135.12% 至 149.37%,营收规模较上年同期明显增长,符合市场对 AI GPU 需求高增长的预期。
在产品方面,摩尔线程旗舰产品 MTT S5000 已实现规模量产,并保持稳定商业化交付。该产品定位于大模型训练、推理及高性能计算的全功能 GPU 智算卡,基于第四代 MUSA 架构“平湖”打造。来源提到,MTT S5000 单卡 AI 算力最高可达 1000 TFLOPS,配备 80GB 显存,显存带宽为 1.6TB/s,卡间互联带宽为 784GB/s,并支持从 FP8 到 FP64 的全精度计算。
整体来看,王东关于“推理市场没有万能芯片”的判断,指向了 AI 基础设施竞争的下一阶段:从单纯追求硬件性能,转向以应用为中心的系统优化。随着模型调用量扩大、企业 AI 应用进入深水区,能够把硬件能力、模型效率与服务能力结合起来的厂商,将更有机会在推理市场获得持续增长。