Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能从感知到行动:Gemini Robotics 2 如何重塑具身智能的边界
从感知到行动:Gemini Robotics 2 如何重塑具身智能的边界
AI人工智能

从感知到行动:Gemini Robotics 2 如何重塑具身智能的边界

bingdadabingdada
八月 18, 202656 次阅读约 7 分钟阅读
快速回答

Gemini Robotics 2 是 Google DeepMind 推出的新一代具身智能模型家族,通过视觉-语言-动作模型(VLA)和具身推理模型(ER)的结合,实现了对人形机器人的全身控制、精细灵巧操作以及多机器人协作,是机器人从预设程序走向自主智能的关键一步。

核心要点
  • Gemini Robotics 2 首次实现了对人形机器人的全身智能控制,覆盖从脚趾到指尖的动作。
  • 该模型家族包含 VLA、具身推理和端侧三个版本,分别负责动作执行、任务规划和本地部署。
  • 新模型在灵巧操作上取得突破,既能控制五指机械手完成精细任务,也能操作标准夹爪。
  • Gemini Robotics ER 2 支持多机器人协作,能够规划并执行长达数分钟的多步骤任务。
  • 端侧模型可在数小时内快速适应全新的机器人本体,显著降低部署门槛。
目录

目录

  • 引言:当机器人学会“思考”每一步
  • 核心突破:从单一动作到全身协调
  • 技术架构:三款模型各司其职
  • 灵巧操作:指尖上的精细革命
  • 国内视角:具身智能的竞速与差异
  • 如何获取与部署
  • 常见问题
  • Gemini Robotics 2 和 Gemini Robotics 1 有何区别?
  • 什么是视觉-语言-动作模型(VLA)?
  • Gemini Robotics On-Device 2 的“快速适应”是什么意思?
  • 这些模型目前可以公开使用吗?
  • 关于 Bingdada

引言:当机器人学会“思考”每一步

长期以来,让机器人真正融入人类生活、在复杂环境中自主完成任务的愿景,一直是人工智能领域追求的高地。传统的机器人多依赖预设程序或远程操控,仅能在狭窄、重复的任务序列中运作,缺乏自主学习与适应未知环境的能力。更棘手的是,将一项技能从一个机器人本体迁移到另一个本体上,技术难度极高。这促使研究者们思考:能否构建一个通用的“智能层”,让不同形态的机器人——无论人形还是多臂——都能获得思考、行动与交互的能力?

核心突破:从单一动作到全身协调

Google DeepMind 近期推出的 Gemini Robotics 2 模型家族,正是对这一问题的直接回应。与前代模型相比,其最显著的变化在于将控制能力从“上半身”扩展到“全身”。此前,模型主要控制人形机器人的上肢完成台面任务,而新模型首次实现了对完整人形机器人的控制,将意图转化为智能的全身运动。例如,在控制 Apptronik 的 Apollo 2 人形机器人时,研究人员可以下达“将浇水壶放入底层架子的绿色箱子中”的指令。机器人需要自主完成行走、蹲下、抓取、伸展等一系列连贯动作。尽管目前运动速度仍有提升空间,但这标志着机器人向完成需要全身协调的复杂现实任务迈出了关键一步。这种“整体智能”的实现,源于模型能够对每一个动作进行推理,而非机械执行。

技术架构:三款模型各司其职

Gemini Robotics 2 并非单一模型,而是一个功能互补的模型家族,旨在覆盖从高端推理到边缘部署的全链条需求:

  1. Gemini Robotics 2(VLA 模型):这是最先进的视觉-语言-动作模型,将视觉与语言输入直接转化为电机控制指令。它能够控制完整的人形机器人(从脚趾到指尖)以及其他双臂机器人,并在手部与夹爪操作上展现出新的灵巧水平。
  2. Gemini Robotics ER 2(具身推理模型):作为机器人的“高级大脑”,这是一个视觉语言模型,负责与人类沟通、理解物理世界并规划长达数分钟的多步骤任务。其新增的团队协作能力,让多台机器人可以分工配合,共同完成任务。
  3. Gemini Robotics On-Device 2(端侧 VLA 模型):针对在机器人设备上本地运行进行了优化,效率极高。该模型最大的亮点是能够在仅需数小时数据的情况下,快速适应全新的机器人本体,这大大降低了部署门槛。

灵巧操作:指尖上的精细革命

除了全身控制,Gemini Robotics 2 在灵巧操作方面也带来了显著提升。为了让机器人在家庭和工作场所真正有用,精细操作能力不可或缺。新模型能够控制具有 22 个自由度的五指 SharpaWave 机械手,完成如打绳结或密封拉链袋等精细动作。同时,它也能操作标准的两指平行夹爪(如 Franka Duo 平台上的 Robotiq 夹爪),执行紧密包装等复杂任务。虽然多指灵巧操作仍具挑战性,但模型在基于夹爪的灵巧任务和全身任务中已展现出中高成功率。这种跨不同末端执行器的适应能力,意味着同一套模型逻辑可以驱动形态各异的机械结构,极大地扩展了应用范围。

国内视角:具身智能的竞速与差异

Google DeepMind 的这一进展,也为国内具身智能领域提供了参照。国内科技大厂如百度(文心一言)、阿里巴巴(通义千问)、字节跳动(豆包)以及专注大模型的 DeepSeek、智谱(GLM)、月之暗面(Kimi)等,均在多模态大模型上投入巨大,并逐渐向机器人方向延伸。与 Gemini Robotics 2 强调的“通用智能层”和跨本体泛化能力不同,国内部分厂商更倾向于结合硬件制造优势,走“软硬一体”的垂直整合路线。例如,一些公司专注于特定场景(如仓储物流、家庭服务)的机器人本体研发,并为其定制模型。从技术路线上看,国内在视觉-语言-动作模型的端侧部署和高效推理方面进展迅速,但在像 Gemini Robotics ER 2 这样具备长时程规划与多机器人协作的高级推理模型上,仍处于追赶阶段。未来,如何将大模型的通用推理能力与机器人硬件的物理约束更紧密地结合,将是国内外共同面临的课题。

如何获取与部署

对于开发者与研究人员,Gemini Robotics ER 2 现已可通过 Google AI Studio 使用,并在 Gemini Enterprise Agent Platform 上提供私有预览。而 VLA 模型和端侧模型则向早期合作伙伴开放。Google 官方开发者博客提供了如何将这些模型适配到自有硬件的详细指南。这标志着具身智能的研发门槛正在降低,更多团队将有机会基于此构建定制化的机器人应用。

常见问题

Gemini Robotics 2 和 Gemini Robotics 1 有何区别?

Gemini Robotics 2 在上一代的基础上,将控制能力从上半身扩展到全身,实现了更复杂的全身协调动作。同时,它还引入了更强的灵巧操作能力(支持五指手和夹爪)以及多机器人协作功能。

什么是视觉-语言-动作模型(VLA)?

VLA 模型是一种将视觉输入(图像)和语言输入(指令)直接转化为机器人动作指令的模型。它跳过了传统机器人编程中繁琐的中间表征步骤,让机器人能更直接地理解任务意图并执行。

Gemini Robotics On-Device 2 的“快速适应”是什么意思?

这意味着该模型在部署到一种全新的机器人硬件上时,只需要采集数小时的该机器人数据,就能完成适配并开始工作,而无需重新进行大规模的模型训练。这大大加快了机器人从实验室到实际应用的落地速度。

这些模型目前可以公开使用吗?

Gemini Robotics ER 2 推理模型已开放给开发者通过 Google AI Studio 体验。而用于控制机器人的 VLA 模型和端侧模型目前仅向早期合作伙伴开放,尚未全面公开。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目录

  • 引言:当机器人学会“思考”每一步
  • 核心突破:从单一动作到全身协调
  • 技术架构:三款模型各司其职
  • 灵巧操作:指尖上的精细革命
  • 国内视角:具身智能的竞速与差异
  • 如何获取与部署
  • 常见问题
  • Gemini Robotics 2 和 Gemini Robotics 1 有何区别?
  • 什么是视觉-语言-动作模型(VLA)?
  • Gemini Robotics On-Device 2 的“快速适应”是什么意思?
  • 这些模型目前可以公开使用吗?
  • 关于 Bingdada
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#具身智能#Google DeepMind#人形机器人#Gemini Robotics 2#视觉语言动作模型
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

物理 AI 的 GPT-3 时刻:Gen1.5 模型如何让机器人学会推理
国产 AI 前线

物理 AI 的 GPT-3 时刻:Gen1.5 模型如何让机器人学会推理

物理 AI 正迎来 GPT-3 时刻。Gen1.5 模型让机器人学会对未见过工具进行推理,展现出从模仿到自主决策的跃迁。本文分析其技术突破、Scaling 定律的延伸,以及国内相关进展。

8月 24约 6 分钟阅读
中国高端钢材新突破:从深海到人形机器人的材料革命
国产 AI 前线

中国高端钢材新突破:从深海到人形机器人的材料革命

中国钢铁行业今年实现7种高端钢材突破,从“蝉翼钢”到低膨胀特种钢,覆盖深海、航空、新能源汽车、人形机器人等新兴赛道,标志着中国钢铁从规模领先迈向技术引领。

8月 24约 7 分钟阅读
机器人咖啡店成WRC焦点:具身智能的终极考场为何是真实商业场景?
国产 AI 前线

机器人咖啡店成WRC焦点:具身智能的终极考场为何是真实商业场景?

2026年WRC大会上,无界动力打造的机器人咖啡店成为焦点,展示了具身智能在真实商业环境中的泛化能力。其核心技术"隐空间世界模型"与"工业+商业"双线策略,为行业提供了可检验的商业化证据链。

8月 24约 9 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧