☰
LIBERO和SimplerEnv到底评测什么?Every-Embodied具身智能Benchmark与数据集完整解读
2026/9/25 18:19:48 网站建设 项目流程

LIBERO和SimplerEnv到底评测什么?Every-Embodied具身智能Benchmark与数据集完整解读

【免费下载链接】every-embodied仅需Python基础,从0构建自己的具身智能机器人;从0逐步构建VLA/OpenVLA/SmolVLA/Pi0, 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied

🤖 正在训练或评测一个具身智能模型,却不知道该选哪个测试集?开源项目Every-Embodied(仅需Python基础,从0构建自己的具身智能机器人,从0逐步构建VLA/OpenVLA/SmolVLA/Pi0)在 09-具身智能数据及评估基准benchmark 章节中,系统整理了LIBERO 数据集与SimplerEnv 评测基准这两个具身智能领域最常用的 Benchmark:前者回答"策略学了多少东西",后者回答"策略在真机上到底行不行"。本文带你用大白话看懂它们分别评测什么、该怎么用。

先搞懂:两个Benchmark各管一摊,别混着看

很多新手会把"数据集"和"评测环境"当成一回事,其实是两类不同的东西:

LIBEROSimplerEnv
本质机器人操作演示数据集 + 评测任务集闭环仿真评测环境
评测目标视觉/空间/交互/长时序四维泛化能力策略在真机场景下的成功率与鲁棒性
机器人本体桌面 Franka 机械臂Google Robot + WidowX 双平台
典型用法训练模仿学习策略,或跑泛化分给已训好的策略"上考场"打分

一句话记忆:LIBERO 是"教材+月考",SimplerEnv 是"模拟真实环境的期末考"。想深入源码细节,可以对照项目中的两份完整教程:

  • LIBERO 数据集深度解析:09-具身智能数据及评估基准benchmark/01-libero.md
  • SimplerEnv 基准测试详解:09-具身智能数据及评估基准benchmark/02-simplerenv.md

LIBERO 到底评测什么:4个套件测4种能力

LIBERO(Lifelong Learning Benchmark for Robot Manipulation)最聪明的地方,是把"泛化能力"拆成了4 个独立维度,每个维度 10 个任务,变量只有一个:

1️⃣ LIBERO-Object:换物体还能做吗?

动作完全一样——"拿起 X 放进篮子",但 X 从字母汤罐头换成番茄酱、奶油芝士。考的是物体视觉特征的鲁棒性:换个颜色、形状,策略会不会就抓瞎了?

2️⃣ LIBERO-Spatial:换位置还能做吗?

操作对象固定(通常是黑碗),但它可能藏在盘子和模子之间、桌子中央、或者木柜的抽屉里。考的是空间语义理解——不能靠背坐标,得真懂"哪里"。

3️⃣ LIBERO-Goal:换目标还能做吗?

目标不再是简单抓取,而是"打开抽屉""把盘子推到炉子前""把碗叠在盘子上"。考的是多种物理交互:开、合、推、放、叠,一样都不能少。

4️⃣ LIBERO-10(Long-Horizon):多步任务还能做吗?

最具挑战性的子集:把两个物体依次放进篮子、放好碗并关上抽屉、开火然后放摩卡壶。考的是长时序推理与因果串联,平均步数 267.7 步,是其他子集的两倍以上。

📊 项目里还做过一次真实的数据统计分析(完整数据见 01-libero.md):

套件任务数Episodes平均步数评测重点
libero_1010379267.7长程时序
libero_goal10428121.6交互目标
libero_object10454147.5物体识别
libero_spatial10432122.6空间定位

💡 一个实用的诊断技巧:如果你的模型 Object 任务做得好、Spatial 任务却拉胯,基本可以断定是空间注意力机制有缺陷,而不是整体能力不行。

SimplerEnv 到底评测什么:18个场景模拟真机考场

SimplerEnv 建立在 ManiSkill2 物理引擎之上,核心使命是弥合Sim-to-Real 鸿沟:它的纹理、光照、物体布局刻意对齐真实机器人数据集(RT-1 和 Bridge Data V2),让仿真评测结果能预测真机表现。

它覆盖2 种机器人平台、18 个标准评估场景:

Google Robot 组(14个场景,基于 RT-1 数据)

模拟厨房/办公场景下的移动操作机器人,重点考三大能力:

  • 抓取:水平/垂直/立姿可乐罐,测不同姿态下的抓取规划
  • 移动接近:MoveNear要求底盘协同移动、接近目标不碰撞,是全身控制的试金石
  • 关节物体:上/中/下三层抽屉的开关,以及"打开抽屉→放入物体"的长程复合任务

WidowX 组(4个场景,基于 Bridge Data V2)

模拟固定基座桌面机械臂的精细操作:

  • PutSpoonOnTableCloth:把勺子放到毛巾上——可变形目标区域的精细放置
  • StackGreenCubeOnYellow:积木堆叠,垂直对齐精度要求极高
  • PutEggplantInBasket:不规则物体入深容器,考抓取点选择与防掉落

关键差异:为什么SimplerEnv更像"真机考场"

SimplerEnv 的精髓在于变体聚合(Variant Aggregation):每个任务每次 Reset 都会随机化参数,同一"任务"实际会产生成百上千种运行状态——

  • 视觉变体:换桌布颜色、改光照、随机撒入干扰物,专治"死记硬背"
  • 物理变体:目标物体位置随机偏移、相机姿态微小扰动,模拟真实标定误差

它的三大评分指标也值得记住:

  1. 成功率:N 次试验中完成任务的百分比(建议 N≥100)
  2. 平均步数:衡量策略效率,"做成了但磨蹭"照样扣分
  3. Sim-to-Real 相关性:仿真排名与真机排名的相关性——这是 SimplerEnv 独有的硬指标,一个靠谱的仿真基准应该能预测哪个策略真机上更强

⚠️ 新手避坑:不同 Benchmark 公布的成功率不要直接横向比较。机器人本体、初始状态、最大步数、成功判定都可能不同,项目里的选择基准检查表总结得很到位。

顺带认识:EBench 与VR数据采集

项目同一章节还覆盖了两个延伸方向,可按需深入:

  • EBench:基于 Isaac Sim 4.1 的具身操作评估基准,项目里走通了"规划→轨迹生成→RGB渲染→导出视频"的最小链路,一张 24GB 显存的卡即可跑通 smoke test。
  • VR 数据采集:用 Quest 3 头显遥操作采集训练数据的 Python 方案,是低成本获取真机数据的实用路线。

对应的资料入口:09-具身智能数据及评估基准benchmark/04-EBench.md、09-具身智能数据及评估基准benchmark/03-VR数据采集.md。

新手选型建议:3个问题定方向

  1. 你在训练阶段还是评测阶段?训练阶段优先用 LIBERO(数据格式友好、规模适中);要给已训好的策略打分,选 SimplerEnv。
  2. 你关心哪种泛化?想知道模型"短板在哪",用 LIBERO 的四个套件分项诊断;想知道"真机上能不能用",用 SimplerEnv 的变体聚合协议。
  3. 你的算力与协议匹配吗?对照项目中的基准检查表逐项核对:任务覆盖、固定初始状态、机器人兼容性、许可证——确定后在实验记录中写明任务子集、回合数与聚合方式,保证不同模型在同一协议下可比。

更多开源模型与数据集的对照资料,可继续浏览 06-策略抓取或抓取VLA/01VLA相关总结综述.md,以及项目整体的学习路线 README.md。

【免费下载链接】every-embodied仅需Python基础,从0构建自己的具身智能机器人;从0逐步构建VLA/OpenVLA/SmolVLA/Pi0, 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询