2026年7月30日,谷歌旗下人工智能实验室DeepMind正式发布新一代多模态模型Gemini Robotics 2,该版本首次实现大模型对人形机器人的原生操控能力,被业界视为通用人工智能向物理世界落地的重要里程碑。目前该技术仅面向合作方开放测试,实体场景落地的安全风险、伦理边界等问题仍待进一步厘清。

此次发布的Gemini Robotics 2是DeepMind在机器人AI领域布局6年交出的核心成果,此前多个版本的Gemini模型仅能处理文本、图像、音频等数字世界内容,而新版本直接将大模型的推理能力延伸到了物理操作场景。
过去几年,全球头部AI厂商均将实体交互视为大模型的下一个核心增长赛道:OpenAI先后注资人形机器人公司Figure、1X Technologies,微软也在为工业机器人场景研发专用大模型,行业普遍认为实体AGI的落地将打开万亿美元级的新市场。
据DeepMind公开的实验室测试数据,Gemini Robotics 2操控人形机器人完成物品拾取、设备调试、场景整理等12类日常任务的成功率,比上一代专门面向机器人的AI系统提升了72%,适配未知场景的泛化速度更是提升了3倍。
此前机器人AI系统普遍采用模块化拼接架构,感知模块、决策模块、动作控制模块相互独立,需要大量定制化适配才能完成特定场景操作,泛化能力极低。而Gemini Robotics 2首次实现了端到端感知动作链路的原生整合,多模态感知信息(视觉、触觉、空间定位)输入模型后,可直接输出机器人关节控制指令,无需中间适配层。
DeepMind CEO戴米斯·哈萨比斯在发布会上表示,“我们不需要再为每个机器人、每个场景单独训练模型,Gemini Robotics 2可以像人类适应新环境一样,快速学会操作不同形态的机器人,完成不同类型的实体任务”。
尽管技术突破获得了业界的广泛关注,Gemini Robotics 2的落地仍然面临不小的争议。不少AI安全研究者指出,具备物理操作能力的大模型一旦出现决策失误,可能会对周边人员造成直接的物理伤害,此外机器人的感知系统收集的场景、人物数据也存在隐私泄露风险,恶意使用者甚至可能利用该技术开发攻击性设备。
目前DeepMind仅向经过筛选的科研机构、工业合作伙伴开放Gemini Robotics 2的测试权限,明确禁止将其应用于医疗、公共服务等直接接触普通用户的场景,相关负责人透露,消费级场景的落地至少还要等到2028年之后,且会配套完善的安全审核机制。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。