谷歌(Google)日前推出Gemini Robotics 2,这是一款专为控制人形机器人设计的全新机器人模型,使机器人具备行走、弯腰、保持平衡和操控物体的能力,同时能够完成复杂任务。据该公司介绍,该系统还可协调多台机器人协同作业,并能通过仅数小时的训练适配不同形态的机器人本体。
此次发布基于今年早些时候推出的Gemini Robotics,新版本将能力从桌面级操控扩展至全身运动控制。谷歌同时发布了两款配套模型:用于高级推理的Gemini Robotics ER 2,以及可在机器人本地运行、无需云端连接的Gemini Robotics On-Device 2。
与编程执行重复任务的传统机器人不同,新模型旨在通过推理完成动作、适应陌生环境,并在极少重新训练的情况下执行多步骤任务。
谷歌表示,这套视觉-语言-动作模型可同时控制人形机器人和双臂机器人系统,使其能够使用双手或机械夹爪完成家务和工业任务。
超越单一任务:全身控制与灵巧操作
最大的突破之一在于全身控制。此前模型主要聚焦于上肢运动,而Gemini Robotics 2使人形机器人能够穿越房间、下蹲、伸展并与物体交互。
在演示中,谷歌的模型控制了Apptronik公司的Apollo 2人形机器人,引导其拿起洒水壶、穿过房间并将其放置在下层架子上。同一模型检查点还被用于其他机器人平台,包括Franka Duo,展示了其跨不同机器人形态的通用能力。
谷歌表示,该模型还显著提升了灵巧性。它可操作Apollo 2的五指机械手完成扎垃圾袋、密封自封袋和拧下灯泡等任务。在使用双指夹爪的工业平台上,模型可执行精密插入、工具操作和物体放置等任务。
此外,谷歌通过Google AI Studio提供Gemini Robotics ER 2具身推理模型,并在Gemini Enterprise Agent平台上开启私有预览。视觉-语言-动作模型和设备端模型则向早期合作伙伴开放。
更智能的机器人协作
谷歌表示,Gemini Robotics ER 2充当机器人的高级推理引擎,能够理解语音指令、将其拆解为多个步骤,并持续监控进度直至任务完成。
更新后的模型可执行长达数分钟的任务序列,同时做出数百项决策。它还能从失败动作中恢复,并根据环境变化做出调整,而非遵循固定程序。
另一项新能力是多机器人协作。不同类型的机器人现在可以相互通信并分工协作,完成单台机器难以独立完成的作业。
对于无法连接互联网的场景,谷歌推出了Gemini Robotics On-Device 2。该公司称,该模型可在机器人硬件上本地运行,仅需数小时内收集的不到200个训练样本,即可适配全新的双臂机器人设计。
谷歌还推出了ASIMOV-Agentic基准测试,用于评估机器人安全性,包括机器人是否拒绝不安全动作、识别不确定性以及必要时请求人工帮助。谷歌表示,Gemini Robotics ER 2还改进了人体接近检测能力,当人员靠得过近时机器人可安全停止动作。
19 0
登陆后参与评论
2026-07-31 08:43:04
2026-07-31 08:40:55
2026-07-31 08:38:58
2026-07-30 08:39:31
2026-07-30 08:32:02
2026-07-30 08:27:22
2026-07-29 08:42:44
2026-07-28 09:03:14
2026-07-28 09:01:06
2026-07-28 08:49:27
2026-07-27 08:51:42
2026-07-27 08:44:08