人工智能

北大等团队研制相变忆阻器神经动力学芯片:单步运算时延压缩至 2.12 毫秒

2026年7月5日 · admin
openmagic ad

据北京大学信息工程学院消息,新基石研究员、信息工程学院院长、广东省存算一体芯片重点实验室主任杨玉超教授团队,联合中国科学院上海微系统与信息技术研究所宋志棠研究员团队等,在《科学》发表新成果,研制出全球首个基于相变忆阻器的毫秒级神经动力学系统芯片。来源显示,该芯片首次将神经动力学系统的单步运算时延压缩至 2.12 毫秒,针对相变型忆阻器长期面临的“可控存内计算”难题给出了新的硬件实现路径。

神经动力学计算为何需要专用芯片

神经动力学系统结合了神经网络的表达能力与微分方程连续演化机制,适用于物理世界建模、计算成像、脑建模等对连续状态变化敏感的场景。与常见离散推理任务不同,这类系统往往需要在时间维度上反复迭代,既要保持较高建模精度,又要尽可能降低延迟。来源指出,自该类系统诞生以来,如何实现低延迟实时计算,一直是限制其走向实际应用的核心瓶颈。

传统数字硬件在执行这类任务时,通常会产生频繁的数据读写、乘法运算、缓存访问和数据搬运开销。对于需要快速反馈的脑机接口、实时成像或复杂物理建模任务来说,这些开销会直接影响系统响应速度。此次研究的核心思路,是把一部分计算过程尽可能放到存储单元内部完成,即通过存内计算减少数据往返移动。

相变忆阻器承担“可控存内计算”角色

研究团队提出了基于相变型忆阻器的“可控存内计算”新范式。按照来源介绍,该方案通过调控相变存储器的电导漂移和多级电导特性,构建精准可控的原位存内计算机制,并将器件物理特性与神经动力学算法进行系统融合。

在芯片设计上,团队实现了自适应积分步长的原位搜索,以及多级电导的存内乘累加计算。芯片采用 40 纳米工艺制造,存内计算与步长漂移阵列总面积为 0.28 平方毫米,并配备编程脉冲生成电路、模数转换器等外围电路。来源显示,芯片运行频率为 50 MHz,单步积分仅需 9 级流水,最终达到2.12 毫秒的神经动力学单次迭代计算时延

  • 器件基础:利用相变器件电导漂移与多级电导两类可控特性。
  • 计算方式:把积分步长搜索、乘累加等操作推进到存内完成。
  • 芯片指标:40 纳米工艺,阵列面积 0.28 平方毫米,运行频率 50 MHz。
  • 性能结果:单次迭代时延达到 2.12 毫秒,进入毫秒级运行区间。

性能对比与产业解读:对脑机接口和边缘智能有启示

实验结果显示,在执行相同神经动力学运算时,该系统相比当前先进专用加速器 ASIC 实现 3.82 至 36.27 倍速度提升,并实现 11.75 至 24.73 倍功耗降低;在脑皮层表面重建等高保真脑建模任务中,相比 NVIDIA A100 GPU 提速达到 50.38 至 478.18 倍。对于中文科技产业读者而言,这组数据的意义不只在于“更快”,更在于它展示了非冯·诺依曼计算路径在特定 AI 科学计算任务中的潜力

脑机接口是该成果被重点提及的应用方向。未来的脑机系统如果要从简单神经信号识别走向实时脑状态建模,需要在很短时间内理解大脑状态、预测神经动力学变化,并根据反馈进行闭环调控。毫秒级高保真脑建模芯片有望为个体化、动态化、可解释的脑状态模型提供底层算力支持。

从更大的 AI 硬件趋势看,当前大模型训练与推理主要依赖 GPU、ASIC 等数字计算体系,而存算一体、忆阻器、类脑芯片等方向则试图解决数据搬运和能效瓶颈。此次成果并不意味着通用 GPU 会被替代,但它说明,在神经动力学、连续系统模拟、实时感知控制等任务中,围绕算法特性定制器件与芯片架构可能带来数量级的效率改善。

来源显示,相关工作入选“面向 2030 北京大学重大培育项目”,并获得新基石研究员项目、国家重点研发计划、国家自然科学基金、广东省存算一体芯片重点实验室、深圳市重点产业研发计划等支持。后续该类芯片能否从实验系统走向可规模化应用,还取决于器件一致性、系统集成、软件工具链与应用生态等因素,但此次研究已为神经动力学计算硬件化提供了重要样本。