LIBERO和SimplerEnv到底评测什么?Every-Embodied具身智能Benchmark与数据集完整解读
【免费下载链接】every-embodied仅需Python基础,从0构建自己的具身智能机器人;从0逐步构建VLA/OpenVLA/SmolVLA/Pi0, 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied
🤖 正在训练或评测一个具身智能模型,却不知道该选哪个测试集?开源项目Every-Embodied(仅需Python基础,从0构建自己的具身智能机器人,从0逐步构建VLA/OpenVLA/SmolVLA/Pi0)在 09-具身智能数据及评估基准benchmark 章节中,系统整理了LIBERO 数据集与SimplerEnv 评测基准这两个具身智能领域最常用的 Benchmark:前者回答"策略学了多少东西",后者回答"策略在真机上到底行不行"。本文带你用大白话看懂它们分别评测什么、该怎么用。
先搞懂:两个Benchmark各管一摊,别混着看
很多新手会把"数据集"和"评测环境"当成一回事,其实是两类不同的东西:
| LIBERO | SimplerEnv | |
|---|---|---|
| 本质 | 机器人操作演示数据集 + 评测任务集 | 闭环仿真评测环境 |
| 评测目标 | 视觉/空间/交互/长时序四维泛化能力 | 策略在真机场景下的成功率与鲁棒性 |
| 机器人本体 | 桌面 Franka 机械臂 | Google Robot + WidowX 双平台 |
| 典型用法 | 训练模仿学习策略,或跑泛化分 | 给已训好的策略"上考场"打分 |
一句话记忆:LIBERO 是"教材+月考",SimplerEnv 是"模拟真实环境的期末考"。想深入源码细节,可以对照项目中的两份完整教程:
- LIBERO 数据集深度解析:09-具身智能数据及评估基准benchmark/01-libero.md
- SimplerEnv 基准测试详解:09-具身智能数据及评估基准benchmark/02-simplerenv.md
LIBERO 到底评测什么:4个套件测4种能力
LIBERO(Lifelong Learning Benchmark for Robot Manipulation)最聪明的地方,是把"泛化能力"拆成了4 个独立维度,每个维度 10 个任务,变量只有一个:
1️⃣ LIBERO-Object:换物体还能做吗?
动作完全一样——"拿起 X 放进篮子",但 X 从字母汤罐头换成番茄酱、奶油芝士。考的是物体视觉特征的鲁棒性:换个颜色、形状,策略会不会就抓瞎了?
2️⃣ LIBERO-Spatial:换位置还能做吗?
操作对象固定(通常是黑碗),但它可能藏在盘子和模子之间、桌子中央、或者木柜的抽屉里。考的是空间语义理解——不能靠背坐标,得真懂"哪里"。
3️⃣ LIBERO-Goal:换目标还能做吗?
目标不再是简单抓取,而是"打开抽屉""把盘子推到炉子前""把碗叠在盘子上"。考的是多种物理交互:开、合、推、放、叠,一样都不能少。
4️⃣ LIBERO-10(Long-Horizon):多步任务还能做吗?
最具挑战性的子集:把两个物体依次放进篮子、放好碗并关上抽屉、开火然后放摩卡壶。考的是长时序推理与因果串联,平均步数 267.7 步,是其他子集的两倍以上。
📊 项目里还做过一次真实的数据统计分析(完整数据见 01-libero.md):
| 套件 | 任务数 | Episodes | 平均步数 | 评测重点 |
|---|---|---|---|---|
| libero_10 | 10 | 379 | 267.7 | 长程时序 |
| libero_goal | 10 | 428 | 121.6 | 交互目标 |
| libero_object | 10 | 454 | 147.5 | 物体识别 |
| libero_spatial | 10 | 432 | 122.6 | 空间定位 |
💡 一个实用的诊断技巧:如果你的模型 Object 任务做得好、Spatial 任务却拉胯,基本可以断定是空间注意力机制有缺陷,而不是整体能力不行。
SimplerEnv 到底评测什么:18个场景模拟真机考场
SimplerEnv 建立在 ManiSkill2 物理引擎之上,核心使命是弥合Sim-to-Real 鸿沟:它的纹理、光照、物体布局刻意对齐真实机器人数据集(RT-1 和 Bridge Data V2),让仿真评测结果能预测真机表现。
它覆盖2 种机器人平台、18 个标准评估场景:
Google Robot 组(14个场景,基于 RT-1 数据)
模拟厨房/办公场景下的移动操作机器人,重点考三大能力:
- 抓取:水平/垂直/立姿可乐罐,测不同姿态下的抓取规划
- 移动接近:
MoveNear要求底盘协同移动、接近目标不碰撞,是全身控制的试金石 - 关节物体:上/中/下三层抽屉的开关,以及"打开抽屉→放入物体"的长程复合任务
WidowX 组(4个场景,基于 Bridge Data V2)
模拟固定基座桌面机械臂的精细操作:
PutSpoonOnTableCloth:把勺子放到毛巾上——可变形目标区域的精细放置StackGreenCubeOnYellow:积木堆叠,垂直对齐精度要求极高PutEggplantInBasket:不规则物体入深容器,考抓取点选择与防掉落
关键差异:为什么SimplerEnv更像"真机考场"
SimplerEnv 的精髓在于变体聚合(Variant Aggregation):每个任务每次 Reset 都会随机化参数,同一"任务"实际会产生成百上千种运行状态——
- 视觉变体:换桌布颜色、改光照、随机撒入干扰物,专治"死记硬背"
- 物理变体:目标物体位置随机偏移、相机姿态微小扰动,模拟真实标定误差
它的三大评分指标也值得记住:
- 成功率:N 次试验中完成任务的百分比(建议 N≥100)
- 平均步数:衡量策略效率,"做成了但磨蹭"照样扣分
- Sim-to-Real 相关性:仿真排名与真机排名的相关性——这是 SimplerEnv 独有的硬指标,一个靠谱的仿真基准应该能预测哪个策略真机上更强
⚠️ 新手避坑:不同 Benchmark 公布的成功率不要直接横向比较。机器人本体、初始状态、最大步数、成功判定都可能不同,项目里的选择基准检查表总结得很到位。
顺带认识:EBench 与VR数据采集
项目同一章节还覆盖了两个延伸方向,可按需深入:
- EBench:基于 Isaac Sim 4.1 的具身操作评估基准,项目里走通了"规划→轨迹生成→RGB渲染→导出视频"的最小链路,一张 24GB 显存的卡即可跑通 smoke test。
- VR 数据采集:用 Quest 3 头显遥操作采集训练数据的 Python 方案,是低成本获取真机数据的实用路线。
对应的资料入口:09-具身智能数据及评估基准benchmark/04-EBench.md、09-具身智能数据及评估基准benchmark/03-VR数据采集.md。
新手选型建议:3个问题定方向
- 你在训练阶段还是评测阶段?训练阶段优先用 LIBERO(数据格式友好、规模适中);要给已训好的策略打分,选 SimplerEnv。
- 你关心哪种泛化?想知道模型"短板在哪",用 LIBERO 的四个套件分项诊断;想知道"真机上能不能用",用 SimplerEnv 的变体聚合协议。
- 你的算力与协议匹配吗?对照项目中的基准检查表逐项核对:任务覆盖、固定初始状态、机器人兼容性、许可证——确定后在实验记录中写明任务子集、回合数与聚合方式,保证不同模型在同一协议下可比。
更多开源模型与数据集的对照资料,可继续浏览 06-策略抓取或抓取VLA/01VLA相关总结综述.md,以及项目整体的学习路线 README.md。
【免费下载链接】every-embodied仅需Python基础,从0构建自己的具身智能机器人;从0逐步构建VLA/OpenVLA/SmolVLA/Pi0, 深入理解具身智能项目地址: https://gitcode.com/gh_mirrors/ev/every-embodied
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考