人工智能

谷歌 DeepMind 发布 Gemini Robotics ER 2:连续视频理解、多机器人协作成核心升级

2026年7月31日 · admin
openmagic ad

据 IT之家 7 月 31 日消息,谷歌 DeepMind 于 7 月 30 日发布博文,宣布推出面向机器人场景的新模型 Gemini Robotics ER 2。来源显示,这是谷歌目前面向机器人的最强具身推理模型,可被理解为机器人系统中的“高级大脑”:它负责理解人类指令、感知物理环境、规划多步骤任务,并把具体动作分派给更底层的视觉-语言-动作(VLA)模型执行。该模型现已通过 Gemini API 和 Google AI Studio 向开发者提供,并在 Gemini Enterprise Agent Platform 中开启私密预览。

从“听懂指令”走向“看着任务推进”

与此前的 Gemini Robotics ER 1.6 相比,ER 2 最突出的变化是对连续视频流的分析能力。过去许多机器人系统更像是“执行一步、暂停判断、再执行下一步”,在真实环境中容易出现停顿,也难以及时发现失败动作。来源显示,Gemini Robotics ER 2 可以持续观看视频,跟踪自身任务进度,并在出现偏差时调整或重试,从而判断何时进入下一阶段。

这意味着机器人不只是对单张图片或短暂片段做判断,而是能够围绕一个正在发生的任务建立更连续的理解。例如在倒咖啡、搬运物体、交接工具等过程中,系统需要识别“关键时刻”是否已经到来,而不是机械地按固定脚本运行。

  • 任务进度分类:Gemini Robotics ER 2 在相关测试中的准确率为 57.4%,可帮助机器人修正失败步骤,而不必重启整个工作流。
  • 关键时刻定位:在 moment-finding 测试中,模型需要找出关键事件对应的视频帧,例如何时停止向杯中倒咖啡;ER 2 准确率为 91.3%,平均绝对时间误差为 0.96 秒。
  • 低延迟执行:谷歌称该模型以更低计算成本达到接近更大模型类别的精度,执行速度为其 4 倍,并满足现实机器人安全运行所需的亚秒级延迟要求。

工具调用与实时接口:机器人智能体化加速

除视觉理解外,Gemini Robotics ER 2 还支持原生调用 Google Search 或开发者自定义函数。这一能力使机器人不再局限于本地感知和预置流程,而可以在需要时调用外部信息或企业内部工具。对于开发者而言,这类似于把大模型智能体的工具调用能力迁移到物理机器人场景中。

来源还提到,Gemini Robotics ER 2 接入 Gemini Live API 的双向流式端点,面向对延迟敏感的机器人任务。对于机器人而言,延迟不是单纯的体验问题,而直接关系到动作安全和任务稳定性。若模型需要在执行中同步推理后续步骤,就必须尽量减少“停止—思考—再行动”的空档。

影响解读:具身 AI 的竞争点正在转向系统协同

Gemini Robotics ER 2 的发布表明,具身智能竞争正在从单点动作能力,转向持续感知、任务规划、工具调用与多机器人协同的系统能力。来源显示,该模型支持多机器人协作,不同类型机器人可以依靠共享语义理解进行沟通、交接任务,并完成单台设备难以独立完成的复杂工作流。谷歌展示了 Apptronik 的 Apollo 2 与 Franka 的 FR3 Duo 协作案例。

这对产业侧有两层意义。第一,机器人部署的上限不再只由单个机械臂或人形机器人的硬件能力决定,软件层的任务编排和语义理解会变得更关键。第二,企业未来可能不是采购一台“全能机器人”,而是让不同形态机器人在同一智能层调度下协同工作,例如移动、抓取、检查、交付分别由不同设备完成。

不过,从来源给出的测试结果看,ER 2 仍处在逐步走向真实复杂场景的阶段。任务进度分类准确率显示,机器人对连续任务状态的判断还有提升空间;但关键时刻定位和低延迟能力,则说明谷歌正在补齐机器人从实验室演示走向实际作业所需的基础能力。对于关注 AI 工具链和机器人开发的中文开发者来说,Gemini API、Google AI Studio 以及相关配置和提示词示例代码的开放,意味着具身推理模型开始进入可调用、可集成的开发流程。