🔧 AI 知识库

谷歌深夜大招!机器人学会看仪表盘干活,成功率飙升 300%

原文链接

谷歌深夜大招!机器人学会看仪表盘干活,成功率飙升 300%

原文链接:https://mp.weixin.qq.com/s/dCacg19U4T7KwD-KrlzVhA 作者:许丽思 | 来源:智东西 | 2026-04-15

摘要

谷歌发布 Gemini Robotics-ER 1.6,联手波士顿动力,让机器人学会读取仪表盘。核心升级:点位定位(计数/距离估算)、多视角推理(遮挡环境下的任务完成判断)、仪表读数(圆形压力表/垂直液位计/数字读数)。仪表识别成功率从 23% 飙到 93%(飙升 300%)。波士顿动力 Spot 四足机器人可实现全自主巡检。同时是谷歌安全表现最优的机器人模型。


核心升级三方面

1. 点位定位(Pointing & Counting)

基础能力。正确识别图中有 2 把锤子、1 把剪刀、6 把钳子,对不存在的手推车和电钻不会错误标注。vs 1.5 会漏掉剪刀产生幻觉。先通过点位计数物体,再结合数学计算提高尺寸/距离估算准确性。

2. 多视角推理

综合多个摄像头画面,即便动态变化或被遮挡环境,也能判断任务是否完成(如"把蓝色笔放进黑色笔筒")。任务成功判断(Success Detection)是机器人自主性的关键——决定重试还是进入下一步。

3. 仪表读数(新增,与波士顿动力合作)

机器人能读懂圆形压力表、垂直液位计、现代数字读数设备。这是复杂的视觉推理过程:精确感知指针/液位/边界/刻度线,结合拍摄角度畸变估算实际数值,有些表盘多根指针对应不同小数位需综合判断。


成绩单

任务成功率
指向与计数80%
单视角成功检测90%
多视角成功检测84%
仪表读数(启用 Agentic Vision)93%

vs 1.5 的 23%,仪表识别成功率飙升 300%。

四代对比(仪表读数)

模型成功率
Gemini Robotics-ER 1.523%
Gemini 3.0 Flash67%
Gemini Robotics-ER 1.686%
1.6 + Agentic Vision93%

Agentic Vision 技术

视觉推理 + 代码执行结合。先放大图像观察仪表细节 → 通过点位标注和代码执行估算比例与区间 → 得到精确读数 → 结合世界知识理解含义。

模型可以先通过点位来计数图像中的物体,或者通过识别关键位置,再结合数学计算提高尺寸或距离估算的准确性。


安全能力

这是谷歌安全表现最优的机器人模型:

  • 对抗性空间推理:对安全策略的遵守程度优于此前所有版本
  • 物理安全约束:判断哪些物体可以被夹爪抓取("不要处理液体""不要抓取超过 20 公斤")
  • 安全隐患识别:基于真实世界伤害事故报告测试,文本场景提升 6%,视频场景提升 10%

判断

对具身智能来说,真正决定机器人能否走出实验室的关键,除了更强的大脑,还需要每一次感知、判断与动作背后都足够安全可靠。即日起可通过 Gemini API 和 Google AI Studio 使用。