首页/说法核对

LIBERO 上的高分,有多少在测环境而不是在测能力

一个基准同时在做两件事:衡量能力,和被高分刷榜。当随机化不够时,后者会赢。

官方说法
在 LIBERO 上分数高,说明模型的操作能力强。排行榜就是能力排名。
实际情况
复现与评测讨论里出现的一类发现是:这个基准里相当一部分样本可以被「统计捷径」拿到高分——模型不必学会抓取逻辑,只要记住环境纹理和物体的常见位置就能过关。也就是说,模型学到的是这个环境长什么样,而不是该怎么抓。
差在哪
基准的设计目标是公平可比,但它同时在优化两件事:衡量能力,和被高分刷榜。当采样、纹理与初始位置缺少足够随机化时,捷径是成本最低的解法——不是作弊,是优化器找到了更省力的路。
什么条件下不差
随机化足够(纹理、光照、初始位置、相机位姿)时,捷径失效,分数才回到能力本身。判断一个基准可不可信,看它写了多少随机化的细节,而不是看排行榜排到第几名。
这个站怎么判

看到 LIBERO 或任何仿真基准的分数,先问三件事:初始位置随机化到什么程度、纹理与光照有没有扰动、有没有留出没被调过参的测试集。三个都答不上来,这个分数只能当参考,不能当选型依据。

这不是某一家的问题

「基准被刷」是所有评测体系的通病:只要分数是目标,优化就会朝分数去。差别只在随机化做得好不好、有没有独立的测试集、以及分数被引用时有没有人追问口径。

对动手的人,这件事的实际含义很简单:排行榜决定你去看哪个模型,但只有真机跑通才能决定你用哪个。同一件事在仿真里成功率高十倍,在真机上可能因为一个相机标定就归零。

顺带一个更普遍的规律

凡是被广泛引用的成功率数字,都值得问一句「在什么条件下测的、测了多少次、失败的那些是什么情况」。这一条对论文、对厂商演示、对众筹宣传同样适用。

来源

  • LIBERO 基准论文与后续复现讨论(关于随机化设置与捷径解)
  • 视觉-语言-动作模型的复现性讨论(关于仿真分数与真机表现的差距)

涉及的对象

最后核实 2026-09-28