http://www.gkong.com 2026-08-03 14:26 《中华工控网》原创
当地时间7月30日,Google DeepMind正式推出新一代机器人基础模型系列Gemini Robotics 2,彻底升级前代产品仅能控制机器人上半身完成桌面任务的局限,首次通过单一视觉-语言-动作(VLA)模型实现人形机器人从双腿、躯干到手指的全身自由度控制,同时打通跨硬件适配、多机协作、端侧部署与安全管控能力,成为谷歌布局物理世界通用人工智能的关键里程碑。

长期以来,机器人行业存在两大核心技术断层,制约着实体AI的落地普及。一方面,传统人形机器人普遍采用分层拼接式控制架构,行走平衡、肢体操作等功能依赖独立控制器分别运作,系统协同性差,难以实现边走边操作的自然动作,真实开放环境适配能力不足;另一方面,传统机器人模型针对性硬件训练,更换设备形态、传感器与自由度后,大多需要重新采集数据、迭代训练,行业重复研发成本高,通用化规模效应难以形成。
此次发布的Gemini Robotics 2并非单一模型,而是一套分工明确、可独立运作亦可协同联动的模型家族,包含主力VLA模型、具身推理模型与端侧轻量化模型三大核心组件,精准补齐行业技术短板。
核心的Gemini Robotics 2 VLA模型是DeepMind首款可端到端控制完整人形机器人的视觉-语言-动作模型,能够将摄像头视觉信息与自然语言指令,直接转化为机器人电机控制信号。该模型最大的突破是实现了模型权重通用,同一份参数可适配多款形态差异显著的硬件设备,包括搭载不同机械手的Apptronik Apollo 2人形机器人、Franka Duo双臂平台等,大幅降低跨硬件适配成本,打破传统机器人的设备绑定壁垒。
Gemini Robotics ER 2作为配套的具身推理模型,承担机器人先进“智能大脑”的角色。该视觉语言模型可接收自然语言指令、解析连续视频流,将长达数分钟的复杂多步骤任务拆解为可落地的子任务,全程监控执行进度,在任务失败时自动重试,遇到不确定场景时主动向人类求助。依托Gemini Live API双向流式通信能力,ER 2可实现动作执行与下一步推理同步进行,解决了传统机器人“执行一步、停顿思考一步”的卡顿问题,让机器人动作衔接更流畅。同时,该模型升级了空间推理能力,可捕捉任务执行中的液体洒落、物品滑落等动态事件,识别仪表类型拓展至数字显示屏、直尺等多类设备,大幅提升复杂场景感知精度。

Gemini Robotics On-Device 2则是专为离线、低延迟场景打造的端侧VLA模型,继承前代1.5版本的动作迁移技术优势。即便面对外形、传感器、自由度差异极大的全新机器人平台,该模型仅需不到200组演示样本、数小时适配训练,即可完成落地部署,有效适配无网络、高实时性要求的工业与家用场景。
在官方公开的实测演示中,搭载全套模型的Apptronik Apollo 2人形机器人,可自主完成全流程复杂任务:接收放置指令后,自主绕行障碍物、穿越房间、精准拾取浇水壶,并将其放置于低层货架的指定箱体中,完整实现全身协调作业。同时,新模型首次赋予机器人异构协作能力,无需预设通信协议,不同形态机器人可通过共享语义理解分工协作,完成单一设备无法胜任的复合任务,例如擅长移动的人形机器人与擅长精密操作的机械臂协同作业。
为保障机器人落地安全性,DeepMind同步开源ASIMOV-Agentic基准体系,搭建多层级安全防护框架。该基准可智能甄别不安全指令,支持拒绝违规工具调用、预判任务可行性,在场景不确定时主动请求人类介入。依托ER 2的增强感知能力,机器人可实时检测周边人类距离,在人员靠近时自动平稳停机,大幅提升人机协同场景的安全性,也是谷歌目前安全性表现最优的机器人模型系列。
尽管技术实现重大突破,但Gemini Robotics 2仍存在明显的落地短板,距离商用普及尚有较大距离。官方披露的实测数据显示,机器人抓取任务稳定性参差不齐:桌面物品抓取成功率为68.4%,地面物品抓取成功率仅45.7%,货架物品抓取成功率为76.3%。在精细灵巧操作场景中,能力差距更为显著,拧松灯泡成功率可达92%,但安装灯泡成功率仅36%,垃圾袋打结、密封拉链袋、簸箕收纳等生活化精细任务成功率分别为44%、40%、32%。整体来看,机器人动作速度偏慢,复杂精细操作的稳定性不足。
DeepMind团队也坦诚目前的技术限制。机器人部门副总裁Carolina Parada表示,这套模型是驱动下一代自适应机器人的核心智能层,谷歌的长远目标是搭建通用、高效的机器人物理世界智能体系。机器人部门总监Kanishka Rao则直言,真正的机器人灵活度仍是长期攻关难题,当前机器人多数决策仍需停顿运算,无法达到人类的直觉式反应速度。
从行业格局来看,Gemini Robotics 2的全身控制技术并非行业首创。今年1月,Figure发布的Helix 02模型已实现人形机器人全自由度全身控制,依托三层架构完成长达四分钟、包含61个连续动作的洗碗全流程任务,长时序动作完整性更具优势。但Helix 02模型仅适配自家硬件、不对外开放,而Gemini Robotics 2的核心差异化优势在于通用开放性,可兼容多品牌第三方硬件,同时开放推理层能力供开发者迭代优化。对比主打技能组合泛化的Physical Intelligence π0.7模型,谷歌新品在跨硬件兼容、全身协同控制层面更具优势。
在产业布局上,谷歌此次更新延续了其深耕机器人领域的长期战略。自2025年推出首代Gemini Robotics模型确立语言视觉转动作的开发方向后,谷歌历经早年密集收购、业务收缩、关停Everyday Robots部门的起伏,如今再度加大技术投入,重燃十余年机器人布局野心。目前,Gemini Robotics ER 2已上线Google AI Studio,并开启Gemini Enterprise Agent Platform私有预览,主力VLA模型与端侧模型仅对Apptronik、Franka、敏捷机器人(Agile Robots)等早期合作伙伴开放。
行业分析认为,依托与Apptronik共建的机器人实训体系,Apollo 2机器人持续产出真实场景训练数据,形成“硬件迭代-数据积累-模型升级-能力拓展”的实体AI规模化循环。虽然Gemini Robotics 2在动作稳定性、精细操作、运行速度上仍有短板,但成功验证了机器人行走与操作统一建模的技术方向,为通用物理人工智能的落地,以及人形机器人产业的规模化发展奠定了重要基础。面对OpenAI、英伟达等行业玩家的激烈竞争,谷歌正凭借通用开放的机器人AI模型生态,全力抢占人形机器人产业的技术制高点。