诺亦腾机器人发布 HiPHI:617.5 小时高精度人体运动数据集已开源
据 IT之家 8 月 23 日消息,诺亦腾机器人在 2026 世界机器人大会期间发布并开源了 HiPHI 数据集。这是一套面向人形机器人学习、数字人和计算机图形学研究的高精度光学动作捕捉数据资源,已在 Hugging Face 平台公开上线,并提供相关文档与论文信息。来源显示,HiPHI 总时长达到 617.5 小时,覆盖全身人体运动与人—物交互两大类内容,目标是为具身智能、角色动画和动作生成等方向提供更标准化的真实人体运动数据基础。
数据规模与采集方式:从全身动作到人—物交互
HiPHI 的核心看点在于数据量、精度和结构化程度。据报道,该数据集包含 371.8 小时全身人体运动数据,以及 245.7 小时人—物交互数据,并包含左右镜像版本。对于人形机器人训练而言,全身运动数据能够帮助模型学习站立、行走、跑动、坐下等基础运动模式;而人—物交互数据则更接近真实任务场景,例如搬运、拖拉、接触物体等,需要同时理解人体姿态、物体关系和动作意图。
来源显示,HiPHI 的数据采集来自 132 名动捕演员,采用 90 Hz 频率与亚毫米级光学动作捕捉精度。这意味着其动作轨迹在时间分辨率和空间精度上都具备较高规格,适合用于对动作细节要求较高的研究场景。数据还依据 FrameNet 对人类动作语义的组织框架,以动作单元进行结构化整理,这有助于研究者按语义类别检索、筛选和组合动作片段。
- 总时长:617.5 小时,含左右镜像数据。
- 数据构成:371.8 小时全身人体运动,245.7 小时人—物交互。
- 采集来源:132 名动捕演员参与采集。
- 技术规格:90 Hz 采样频率,亚毫米级光学动捕精度。
- 组织方式:依据 FrameNet 语义框架,以动作单元结构化整理。
为什么对人形机器人重要
过去一年,人形机器人从演示走向真机任务的速度明显加快,但机器人要在现实世界中完成自然、稳定、可泛化的动作,仍然依赖高质量训练数据。相比单纯的仿真生成数据,真实人体动作捕捉数据可以提供更接近人类运动规律的轨迹、节奏和身体协调方式。对人形机器人而言,这类数据可用于模仿学习、动作先验建模、运动控制策略训练,以及仿真到真机迁移过程中的参考。
IT之家注意到,基于 HiPHI 训练的模型已经在宇树 G1 人形机器人真机部署中实现跑步、坐下、爬行、搬运箱子和拖拉行李箱等动作。虽然来源未披露更详细的训练方法和部署指标,但这说明该数据集并非仅停留在离线研究层面,而是已经被用于实际机器人动作能力验证。对于行业来说,开源高质量动作数据可以降低部分研究门槛,让更多团队在同一数据基准上测试算法、复现实验,并加速具身智能模型迭代。
影响与解读:开源数据将成为具身智能竞争底座
从产业角度看,HiPHI 的开源反映出人形机器人竞争正在从硬件本体、关节执行器和整机控制,进一步延伸到数据资产与训练范式。大模型的发展已经证明,数据质量和规模会直接影响模型上限;在人形机器人领域,动作数据、交互数据和场景数据同样可能成为核心资源。
对于数字人和计算机图形学领域,HiPHI 也具备直接价值。高精度动作捕捉数据可用于生成更自然的角色动画、训练动作生成模型、改进虚拟人姿态控制与行为合成。尤其是在游戏、影视预演、虚拟主播和空间计算应用中,真实人体动作语义和动作单元的结构化整理,有助于提升内容生产效率。
不过,高精度数据集只是第一步。如何将人类动作迁移到不同尺寸、不同自由度、不同驱动能力的人形机器人上,仍涉及运动重定向、动力学约束、安全控制和环境适应等问题。HiPHI 的价值在于为这些问题提供了更丰富的原始材料与公开基准。随着更多机器人厂商、研究机构和工具平台参与,围绕动作数据的开源生态可能会成为下一阶段具身智能落地的重要推动力。