人工智能

后摩智能下代端边 AI 芯片将采用 3D CIM 架构,瞄准大模型本地实时交互

2026年9月23日 · admin
OpenMagic API

据 IT之家 9 月 22 日消息,后摩智能(HOUMO.AI)近日在 2026 全球 AI 芯片峰会上确认,公司下一代面向大模型端边场景的 AI 芯片将采用 3D CIM 存算一体架构。来源显示,这一方案会结合融合存算与 3D DRAM 技术,通过垂直堆叠提升单位面积内的计算能力,并面向端侧超实时思考和互动能力进行设计。对于正在从云端推理走向本地部署的 AI 产业而言,这一信息意味着端边 AI 芯片竞争正在从单纯 TOPS 指标,进一步转向存储、带宽、功耗和散热的系统级优化。

从“存算分离”到 3D CIM,端边 AI 芯片寻找新路径

大模型在端侧运行时,瓶颈并不只在算力本身。模型权重、上下文缓存和多模态数据都需要频繁在存储与计算单元之间移动,这会带来延迟、功耗和带宽压力。后摩智能此次确认采用的 CIM,即存算一体思路,核心方向是让数据尽可能在靠近计算的位置完成处理,减少传统架构中大量数据搬移造成的能效损耗。

来源提到,新一代旗舰芯片将融合存算与 3D DRAM 技术。与平面布局相比,垂直堆叠可以在相同面积内放入更多计算与存储资源。后摩智能方面称,该架构可在同等面积下实现 2 倍算力,并有望进一步优化功耗与散热压力。对于迷你主机、智能终端、机器人、工业边缘设备等空间和功耗都受限的产品来说,这类提升可能比单纯堆更大芯片面积更具现实意义。

端侧“超实时思考和互动”意味着什么

来源显示,这款下代旗舰芯片将具备端侧超实时思考和互动能力。面向中文读者可以理解为:更多 AI 推理任务有机会在本地设备上完成,而不是完全依赖云端服务器。这样做的潜在价值包括更低延迟、更强隐私保护,以及在网络不稳定或离线场景下保持可用。

从应用角度看,端边 AI 的需求正在从“能跑一个模型”升级为“持续、低延迟、多模态地处理任务”。例如桌面 AI 助手需要理解屏幕、语音与文件内容;智能摄像头需要实时分析画面;机器人需要在本地完成感知、规划与反馈。这些场景都要求芯片在有限功耗内持续输出,而不是只在短时间峰值测试中给出高分。

  • 低延迟交互:本地推理可减少云端往返时间,更适合语音对话、视觉识别、机器人控制等实时任务。
  • 能效优先:端侧设备通常受制于体积、散热和供电,存算一体有助于降低数据搬移带来的能耗。
  • 数据本地化:更多处理留在设备端,有利于降低敏感数据上传云端的需求。
  • 产品形态扩展:迷你主机、AI PC、边缘盒子、智能硬件都有可能成为端边 AI 芯片落地载体。

对比 M50:后摩智能正在强化端边 AI 芯片路线

IT之家注意到,后摩智能在 2025 年 7 月发布了后摩漫界 M50 芯片。该芯片典型功耗为 10W,可提供 160TOPS(INT8)或 100TFLOPS(bFP16)算力,并支持 48GB 内存容量和 153.6GB/s 内存带宽。来源还显示,M50 目前已获得超过 150 款产品定点,覆盖丰富应用场景。

这些信息说明,后摩智能并非只停留在架构概念展示,而是已经在端边 AI 芯片产品化方面积累了一定基础。M50 强调在较低功耗下提供独立 NPU 能力,而下一代芯片则进一步把重点放在 3D CIM、3D DRAM 与大模型实时交互上。两者之间的演进关系,反映出端边 AI 芯片正在从“可用的 AI 加速器”走向“面向大模型体验设计的本地计算平台”。

影响与解读:端边大模型竞争进入架构创新阶段

过去一段时间,AI 芯片市场的关注点高度集中在云端训练和数据中心推理,但随着 AI PC、智能座舱、机器人、边缘服务器等设备普及,端边侧也在成为新的竞争焦点。云端大模型依然承担高强度训练和复杂推理任务,但用户日常交互对响应速度、隐私和成本的要求,会推动部分能力下沉到本地。

后摩智能确认下代芯片采用 3D CIM 架构,说明国内 AI 芯片厂商正在尝试用架构创新解决端侧部署难题。需要注意的是,3D 堆叠、存算一体和大容量存储协同并不只是设计问题,也涉及制造、封装、软件栈、模型适配和生态落地。最终产品能否在实际设备中体现出低功耗、高带宽和实时交互优势,还要看后续量产、客户导入和开发工具支持。

总体来看,这一动向值得关注:当端侧大模型从演示走向常态化使用,芯片厂商的竞争将不再只是标称算力,而是围绕模型运行效率、内存带宽、散热控制、软件生态展开。后摩智能的下一代端边 AI 芯片若能如来源所述实现同面积算力提升并缓解功耗散热压力,将为本地 AI 设备带来更大的设计空间。