谷歌深夜大招!机器人学会看仪表盘干活,成功率飙升 300%
原文链接谷歌深夜大招!机器人学会看仪表盘干活,成功率飙升 300%
原文链接:https://mp.weixin.qq.com/s/dCacg19U4T7KwD-KrlzVhA 作者:许丽思 | 来源:智东西 | 2026-04-15
摘要
谷歌发布 Gemini Robotics-ER 1.6,联手波士顿动力,让机器人学会读取仪表盘。核心升级:点位定位(计数/距离估算)、多视角推理(遮挡环境下的任务完成判断)、仪表读数(圆形压力表/垂直液位计/数字读数)。仪表识别成功率从 23% 飙到 93%(飙升 300%)。波士顿动力 Spot 四足机器人可实现全自主巡检。同时是谷歌安全表现最优的机器人模型。
核心升级三方面
1. 点位定位(Pointing & Counting)
基础能力。正确识别图中有 2 把锤子、1 把剪刀、6 把钳子,对不存在的手推车和电钻不会错误标注。vs 1.5 会漏掉剪刀产生幻觉。先通过点位计数物体,再结合数学计算提高尺寸/距离估算准确性。
2. 多视角推理
综合多个摄像头画面,即便动态变化或被遮挡环境,也能判断任务是否完成(如"把蓝色笔放进黑色笔筒")。任务成功判断(Success Detection)是机器人自主性的关键——决定重试还是进入下一步。
3. 仪表读数(新增,与波士顿动力合作)
机器人能读懂圆形压力表、垂直液位计、现代数字读数设备。这是复杂的视觉推理过程:精确感知指针/液位/边界/刻度线,结合拍摄角度畸变估算实际数值,有些表盘多根指针对应不同小数位需综合判断。
成绩单
| 任务 | 成功率 |
|---|---|
| 指向与计数 | 80% |
| 单视角成功检测 | 90% |
| 多视角成功检测 | 84% |
| 仪表读数(启用 Agentic Vision) | 93% |
vs 1.5 的 23%,仪表识别成功率飙升 300%。
四代对比(仪表读数)
| 模型 | 成功率 |
|---|---|
| Gemini Robotics-ER 1.5 | 23% |
| Gemini 3.0 Flash | 67% |
| Gemini Robotics-ER 1.6 | 86% |
| 1.6 + Agentic Vision | 93% |
Agentic Vision 技术
视觉推理 + 代码执行结合。先放大图像观察仪表细节 → 通过点位标注和代码执行估算比例与区间 → 得到精确读数 → 结合世界知识理解含义。
模型可以先通过点位来计数图像中的物体,或者通过识别关键位置,再结合数学计算提高尺寸或距离估算的准确性。
安全能力
这是谷歌安全表现最优的机器人模型:
- 对抗性空间推理:对安全策略的遵守程度优于此前所有版本
- 物理安全约束:判断哪些物体可以被夹爪抓取("不要处理液体""不要抓取超过 20 公斤")
- 安全隐患识别:基于真实世界伤害事故报告测试,文本场景提升 6%,视频场景提升 10%
判断
对具身智能来说,真正决定机器人能否走出实验室的关键,除了更强的大脑,还需要每一次感知、判断与动作背后都足够安全可靠。即日起可通过 Gemini API 和 Google AI Studio 使用。