人工智能

北大团队联合发布忆阻器神经动力学芯片:单步运算时延降至 2.12 毫秒

2026年7月6日 · admin
openmagic ad

据 IT之家 7 月 4 日消息,北京大学集成电路学院官方公众号于 7 月 3 日发布博文称,北京大学杨玉超教授团队联合中国科学院上海微系统与信息技术研究所宋志棠研究员团队,发布了全球首款基于可控存内计算的忆阻器神经动力学芯片。相关成果已于 7 月 3 日发表在《科学》上。来源显示,这款芯片首次将神经动力学系统的单步运算时延压缩至 2.12 毫秒,在脑皮层重建等任务中,相比目前先进 GPU 实现了 50 至 478 倍的提速。

这项进展的核心意义在于,它把长期依赖高性能通用计算平台的复杂神经动力学运算,推进到专用硬件的毫秒级实时计算阶段。对于脑科学建模、三维流形网格生成、实时大脑皮层表面重建等场景而言,时延不只是性能指标,也直接影响系统能否进入交互式、在线化和低功耗部署。

从“算得动”到“实时算”:神经动力学硬件化的关键突破

神经动力学系统通常涉及大量连续状态演化、积分迭代和非线性计算。过去,这类任务主要依赖 GPU 等并行计算设备加速,但受限于数据搬运、存储访问和通用架构开销,实时计算一直是难点。来源称,该研究“一举突破了制约神经动力学长达半个世纪的实时计算瓶颈”,并将硬件系统运行时间推进到毫秒级。

此次芯片采用的是相变型忆阻器路线。忆阻器具备可调电导特性,能够在硬件层面映射部分计算关系;而存内计算则试图把计算过程尽可能放在存储阵列内部完成,减少传统架构中数据在存储器与处理器之间反复搬运带来的延迟和能耗。对于需要反复迭代的神经动力学模型来说,这种架构天然更适合高密度、低时延的矩阵与状态更新计算。

芯片规格:40 纳米工艺,核心阵列面积仅 0.28 平方毫米

根据来源信息,这款芯片采用 40 纳米工艺制造,存内计算与步长漂移阵列总面积为 0.28 平方毫米,并配备编程脉冲生成电路、模数转换器等外围电路。芯片运行频率为 50 MHz,单步积分仅需 9 级流水,最终实现 2.12 毫秒的神经动力学单次迭代计算时延。

从公开信息看,这并不是单纯追求更高频率的数字逻辑芯片,而是利用器件物理特性参与计算。相变型忆阻器的多级电导能力,被用于更精细地映射和调控神经动力学中的计算机制。这类思路与近年来 AI 芯片领域关注的“近存计算”“存算一体”“模拟计算”方向相呼应:当模型与系统越来越复杂,继续依赖冯·诺依曼架构下的数据搬运,可能不再是最优路径。

  • 研究单位:北京大学集成电路学院团队联合中科院上海微系统与信息技术研究所团队推进。
  • 技术路线:基于可控存内计算与相变型忆阻器,实现神经动力学专用计算。
  • 关键指标:单步运算时延压缩至 2.12 毫秒,芯片运行频率为 50 MHz。
  • 应用验证:在脑皮层重建等任务中,相比先进 GPU 提速 50 至 478 倍。

影响解读:对 AI 硬件与脑科学计算意味着什么

对 AI 与科技产业而言,这项成果的价值不只在“更快”,还在于展示了新型器件、存内计算和专用算法系统协同设计的潜力。当前大模型训练与推理主要由 GPU、AI 加速卡和专用 NPU 承担,但在脑科学仿真、连续动力系统、机器人控制、科学计算等场景中,问题形态并不总是标准深度学习矩阵乘法。面向特定模型结构设计硬件,有机会在延迟和能效上取得明显优势。

尤其是在实时大脑皮层表面重建、三维流形网格生成等任务中,毫秒级迭代可能让系统从离线处理走向实时反馈。未来如果相关技术进一步提升稳定性、可编程性和规模化集成能力,或可为神经工程、脑机接口辅助计算、医学影像建模以及具身智能中的动态控制提供新的硬件底座。

当然,从科研芯片到产业化产品仍有距离。忆阻器阵列的一致性、耐久性、外围电路开销、算法适配和软件工具链,都会影响实际落地。但这次成果已经清楚表明:在 GPU 之外,面向特定科学与智能计算任务的新型存算一体芯片正在成为重要探索方向。