谷歌DeepMind发布Gemini Robotics ER 2:支持连续视频理解与多机器协作
7月31日,谷歌DeepMind正式推出Gemini Robotics ER 2模型,这是其面向机器人的最强具身推理模型。ER 2可被视为机器人的“高级大脑”,负责协调处理与人类交流、理解物理世界并规划多步骤任务,随后向更低层级的视觉-语言-动作模型分派具体指令。
相较前代ER 1.6,ER 2最大的突破在于能够分析连续视频流——机器人可据此跟踪自身任务进度,在动作出错时实时调整,并判断何时进入下一步骤。在任务进度分类测试中,ER 2准确率达57.4%;在关键时刻定位测试中,模型能以91.3%的准确率精确识别关键事件发生的视频帧(如判断何时停止倒咖啡),平均时间误差仅0.96秒。
模型还引入“物理智能体”能力——在机器人执行当前任务时同步推理后续步骤,大幅减少传统机器人“停止—思考—再行动”带来的停顿。该功能通过接入Gemini Live API的双向流式端点实现,面向对延迟敏感的机器人任务。
谷歌表示,ER 2以更低计算成本达到接近更大模型的精度,执行速度为前者的4倍,同时满足亚秒级延迟要求。模型还可原生调用Google Search或开发者自定义函数,提升推理任务的灵活性与信息获取能力。在多机器人协作方面,ER 2支持不同类型的机器人通过共享语义理解进行沟通与任务交接,完成单台设备难以独立处理的复杂工作流。谷歌展示了Apptronik Apollo 2与Franka FR3 Duo的协作案例。
Gemini Robotics ER 2现已通过Gemini API和Google AI Studio向开发者公开提供,同时在Gemini Enterprise Agent Platform中开启私密预览。谷歌还同步发布了模型配置和提示词示例代码。这一发布距离今年4月Gemini Robotics 1.6版本推出仅过去三个月,表明谷歌在具身推理领域的研发节奏正明显加快。