打开网易新闻 查看更多图片

设想这样一个场景:你让机器人把桌上的杯子收进托盘。它已经看到了杯子,机械臂正朝杯子伸过去。这时,旁边的人顺手把杯子挪开了几厘米。

对人来说,接着调整一下手的位置就好。对机器人来说,事情可能复杂得多:它之前看到的是旧位置,已经生成的动作也指向旧位置。如果继续执行,手就可能伸向一块空桌面。它能及时看到变化、调整动作,最后把杯子收好吗?

这个小插曲,指向了机器人走进真实生活时必须面对的问题:环境会在机器人行动过程中改变,而任务还需要继续完成。

机器人如何接受一场「考试」?

近年来,机器人开始使用视觉语言动作模型(VLA):输入摄像头画面和「把杯子放进托盘」这样的指令,模型便生成控制机械臂的动作。一些模型还引入世界预测机制,尝试利用对后续场景的预测帮助行动。

判断这些模型做得好不好,需要一套共同的考试题。机器人评测基准提供标准化任务和仿真环境,让不同模型在相同条件下接受测试,再比较谁能完成更多任务。

已有很多鲁棒性评测会在任务开始前改变条件,例如换一个杯子位置、调整光照或改变视角。机器人从第一眼起,看到的就是调整后的场景。

但「杯子一开始就在另一边」和「手伸到一半,杯子才被挪走」,对机器人提出了不同要求。后一种情况下,机器人已经根据旧画面采取行动,还可能有一串尚未执行的动作。它需要在已有的执行过程上,继续应对新的情况。

围绕这一问题,来自Stanford、CMU、MIT、UIUC 和 UT Austin等机构的研究者提出了LIBERO-MAX,将执行过程中的环境变化变成可重复、可比较的测试。

该工作已入选NeurIPS26 Robotics World Modeling Workshop 口头报告(Oral)。Yunbei Zhang与Zijian Jin为共同第一作者,合作作者包括 UT Austin 教授Peter Stone、Stanford 教授Marco Pavone、MIT 博士后Weirui Ye和 NTU 助理教授Jianfei Yang。

打开网易新闻 查看更多图片

  • 论文标题:LIBERO-MAX: Do Robot Policies Adapt When the World Changes?
  • 作者:Yunbei Zhang*、Zijian Jin*、Yuanzhe Liu、Janet Wang、Xilun Zhang、Yuyou Zhang、Zhenyu Zhang、Daoan Zhang、Shuaicheng Niu、Gen Li、Jianfei Yang、Jihun Hamm、Ismini Lourentzou、Weirui Ye、Bo Liu、Peter Stone、Marco Pavone
  • 论文链接:https://arxiv.org/abs/2609.36518
  • 代码链接:https://github.com/liberomax/LIBERO-MAX
  • 项目主页:https://liberomax.github.io/

同一个机器人,两种后续

回到抓杯子的故事。假如机器人最终失败了,怎么判断是杯子被挪走造成的,还是它本来就抓不好?

LIBERO-MAX 为同一个任务安排两次执行。两次执行共享初始状态、指令、模型随机种子,以及变化发生前的全部动作。到了同一个关键时刻,再让它们经历不同的后续:

  • Base:不额外加入中途变化,机器人继续执行。

  • Dynamic:加入一次环境变化,例如移动目标物体,机器人继续尝试完成任务。

如果机器人在 Base 中成功、在 Dynamic 中失败,就能识别出这次变化破坏了一个原本能够完成的任务。即使两次都失败,也会保留在结果中,帮助区分原有能力不足和中途变化带来的影响。

这套设计以 LIBERO-Plus 和 LIBERO-PRO 的任务为基础,构建了8,000 组配对案例、8 类执行中途的变化:目标移动、容器移动、相机视角改变、传感器噪声、光照切换、视觉主题变化、干扰物增加和障碍物插入。

打开网易新闻 查看更多图片

图 1|两次执行在变化前保持一致,再比较加入变化后的任务完成情况。八类事件覆盖物体位置、视觉观测、外观与杂物,以及路径约束。

一次中途变化,影响到底有多大?

研究团队评测了 14 种当前机器人策略,涵盖 VLA、混合架构和世界动作模型(WAM),均使用各自发布的推理配置。每个策略完成 16,000 次执行,主评测累计22.4 万次仿真。

结果显示:所有受测策略的成功率都下降了,降幅为 11.0–25.7 个百分点。

打开网易新闻 查看更多图片

图 2|每一行代表一个策略。空心圆是没有新增中途事件的成功率,实心方块是加入变化后的成功率。所有策略都出现下降。

即使是动态条件下表现最好的 MolmoAct2 和 π₀.₅,成功率也分别只有 66.9%和 65.7%,丢失了不少原本能够完成的任务。对于其中一个受测策略,超过一半的原有成功案例在变化后转为失败。

配对评测因此提供了两种信息:变化后还能完成多少任务,以及哪些原本能够完成的任务被变化打断。

不同类型模型的排名也相互交错,没有一个模型家族始终占优。当前受测的世界动作模型同样需要面对执行中途的变化,世界预测能力能否转化为可靠行动,还需要通过实际任务检验。

杯子移动、视角变化,为什么尤其难?

八类变化带来的损失并不相同。目标或容器移动,以及相机和传感器变化,造成了更明显的共同困难;光照和视觉主题变化通常影响较小。

这与抓杯子的故事形成了直观联系:杯子换了位置,原来的伸手目标需要调整;托盘移动了,放置位置需要更新;摄像头视角改变了,机器人又要从新的画面中理解自己与物体的关系。

打开网易新闻 查看更多图片

图 3|每个圆点代表一个策略的表现变化。按事件拆解结果,可以看清模型在哪些变化下更容易失败。

这种拆解让研究者能够进一步定位问题:应该改进视觉识别、目标更新,还是动作规划?模型改进之后,也可以用同一类事件检查效果。

让机器人多看几次,能解决吗?

一个自然的想法是:环境可能变化,那就让机器人更频繁地看画面、重新生成动作。

机器人策略常常一次预测一串动作,再执行若干步后获取新观测。这样可以减少模型调用,但变化发生时,依据旧画面生成的动作可能仍在执行。

研究团队在同一组 800 个配对案例上,测试了 4 个策略、18 种有效的动作执行间隔。调整间隔确实会改变表现,但所有测试设置下,变化后的成功率仍低于对应的 Base。更频繁的反馈,并未自动消除这道差距。

相机对照实验还发现,同样的视角变化,在第一帧就出现与执行到一半才出现,结果也不同。三个被测策略在中途变化条件下,都比从起点就使用改变后的视角更容易成功。

这说明,评测还需要关注机器人已经走到了哪里、此前执行过哪些动作。面对同样的新画面,不同的执行历史也会影响后续结果。

找到问题之后,能追回多少成功率?

LIBERO-MAX 还可以用来检验针对性的改进。

研究团队选取 300 个固定的传感器噪声案例,在 X-VLA 前加入图像质量检测模块:发现当前图像质量较差时,先修复、去噪,再交给策略处理。策略无需重新训练,检测模块也不会提前收到「变化已经发生」的通知。

打开网易新闻 查看更多图片

表 1|比较原始观测、始终修复和按图像质量触发修复三种处理方式。

按质量触发修复后,变化后的成功率从40.7% 升至 47.7%,提高 7.0 个百分点,Base 成功率基本保持。始终修复也带来了 6.7 个百分点的提升。

这个小规模实验表明,针对特定变化采取补偿措施,能够挽回一部分失败。配对评测则可以同时检查:它改善了多少受扰动任务,以及是否影响原本能够完成的任务。

让「世界变了,还能做完吗」成为机器人评测的核心问题

LIBERO-MAX 提供评测代码、固定案例清单和配对诊断,还提供包含 800 组案例的 Lite 版本,将执行数量降到完整版本的十分之一,方便研究者先做快速验证,再开展完整评测。

机器人进入家庭、办公室或工厂后,环境变化会伴随任务执行不断发生。LIBERO-MAX 希望为变化检测、动作调整、重新规划和自主恢复提供可复现的测试平台,让模型改进能够接受同一套动态环境考验。

回到开头那个被挪走的杯子:可靠的机器人,需要在情况改变之后,仍然把它收进托盘。