财联社8月3日讯(编辑 李莹)谷歌旗下DeepMind近期发布了Gemini Robotics 2系列智能套件,该套件由三款AI模型组成,共同为机器人提供智能支持,且能够跨机型快速适配不同硬件躯体。
(资料图)
DeepMind将其定位为机器人的"智能层"——可供各硬件厂商依托开发的通用基础智能套件。该套件仅需数小时的数据训练即可让AI模型适配全新机身。
这也是Gemini Robotics 2备受关注的核心原因——倘若仿人机器人未来普及度达到笔记本电脑水平,那么谁能提供可在不同机身之间顺畅迁移的通用"大脑",谁就将掌握整个行业的核心话语权。
业内指出,Alphabet、英伟达,以及一批中国科技企业,都在争相抢占"物理AI"技术栈的主导权:即建立一套可用于不同厂商机器人的通用软硬件平台,进而掌握行业标准。
业内指出,这一布局逻辑,与当初移动操作系统创造巨大产业价值的思路一致。
典型代表是安卓:谷歌并未大规模自产手机硬件,而是将安卓系统开放给三星、小米等众多厂商;海量用户与开发者持续涌入形成网络效应,平台借此掌握应用分发渠道、用户流量入口与增值服务体系,不靠销售硬件盈利,长期从整个移动产业持续获取生态收益。
跨机型迁移
Gemini Robotics 2系列共包含三款AI模型,可为仿人机器人及其他类型机器人提供全身控制能力、更精准的操作能力与协同作业能力:
当地时间7月30日,DeepMind公开演示了用同一参数模型控制三台硬件结构互不相同的机器人。其中包括搭载了两套不同机械手的Apptronik Apollo 2机器人,以及一台配备夹爪的独立双臂设备。
2025年推出的初代Gemini Robotics仅能控制机器人上半身;新版可实现全肢体动作控制,支持仿人机器人同步完成行走、下蹲、弯腰、伸展等动作。在演示中,一台Apollo 2机器人走向洒水壶,并将其放置于低层货架。
业内指出,目前该模型效果仍不稳定:在Apollo 2的全身拾取测试中,机器人从桌面拾取物体准确率约68%,货架取物准确率76%,地面取物准确率仅46%。
多指灵巧操作仍是尚未攻克的难题,简易夹爪的表现依旧优于结构复杂的仿人机械手。同时,机器人运动速度与稳定性也有待提升。
目前,三款模型的开放程度不尽相同:具身推理模型Gemini Robotics ER2已经开放;但真正实现全身控制的Gemini Robotics 2模型本体,以及轻量化的On-Device 2版本,目前仍处于早期内测阶段,短期内无法大规模投入实际使用。
DeepMind表示,基于遵守安全约束、主动避让人类等评测指标,Gemini ER2是公司迄今安全性最高的机器人模型。
(财联社 李莹)