李飞飞团队全新统一世界模型:15小时数据兼顾正向仿真、逆向动作生成
2026/8/7 0:57:08 网站建设 项目流程

一站式支撑机器人策略评估、模型规划与动作提取三大具身任务。

——统一世界建模

目录

01 掩码视觉动作完整技术实现逻辑

掩码动作:把动作直接“画”进视频画面

两类互补掩码数据集构建方案

轻量化LoRA微调方案,无全量重训开销

三大下游标准化应用链路

02 横向定位:四类机器人视频世界路线对比

03 实验结果

验证掩码接口不可替代性

跨本体零样本泛化测试

下游任务定量表现

04 一套掩码输入自由切换两大核心功能


李飞飞课题组联合马里兰、哈佛等机构推出Masked Visual Actions(掩码视觉动作),只用一套视频模型、仅15小时虚实混合数据微调:

既能输入机器人轨迹预测环境交互,也能输入物体目标运动反推机器人动作

在单臂机械臂、定制夹爪、人形双臂机器人三类从未见过的设备上全部稳定运行,解决动作表征与视觉预训练模型不兼容、跨本体泛化差、双向建模需分开训练三大难点,为通用机器人仿真、离线策略评测提供轻量化统一底座。

01 掩码视觉动作完整技术实现逻辑

整套框架基于开源14B Wan视频基座模型微调,核心创新是像素级掩码动作接口,配套双数据集构建管线、统一双向推理逻辑,无需新增大量神经网络模块,仅靠LoRA轻量化微调即可落地。

整体架构简洁、适配各类桌面与仿真机器人场景。

▲Masked Visual Actions完整技术总览图

掩码动作:把动作直接“画”进视频画面

摒弃数值动作向量,把任意实体(机械臂/待操作物体)时序轨迹渲染为画面掩码,掩码区域像素完整保留、其余画面填充统一灰色,作为模型输入条件。

简单理解:模型原生任务是视频补全,掩码区域作为已知先验,灰色区域是需要预测的未知画面,天然贴合视频模型预训练的图像修复逻辑,不需要额外跨模态转换层。

对于研究中的核心条件分布:

(灰色画面|掩码实体轨迹,初始帧),掩码实体集合自由切换,切换实体就能切换模型推理方向。

  • 为机器人:正向动力学模型,给定机械臂运动,预测杯子、抽屉等物体交互变化;
  • 为目标物体:逆向动力学模型,给定物体想要到达的轨迹,自动生成配套机器人抓取、搬运动作。

▲正向、逆向掩码推理可视化对比图

这套设计最大优势是本体无关,掩码只记录像素层面运动轮廓,不绑定机器人关节维度、夹爪结构,从未训练的人形双臂机器人输入掩码后,也能生成无穿模、符合物理逻辑交互视频。

两类互补掩码数据集构建方案

研究提供的分割、渲染两条数据生成路径,分别适配真实视频与仿真场景,二者互补解决掩码获取难点。

  • 分割式数据集:

依托SAM分割模型,直接从DROID真实机器人视频里分割机械臂像素,无需机器人URDF模型与相机标定,零成本快速生成大量真实掩码样本;

缺陷是遮挡区域掩码存在信息泄露,测试时无法自定义任意新动作轨迹。

  • 渲染式数据集:

读取视频同步记录的机器人关节状态,加载URDF三维网格结合相机外参渲染半透明机械臂掩码,夹爪高亮红色方便模型识别。

优势是推理阶段能手动生成任意全新动作掩码;短板必须完整标定相机与机器人参数,仅仿真与带状态记录的真实数据集可用。

整套训练数据仅合计15小时,融合DROID真实人机视频、Robocasa仿真操作片段,同时纳入任务失败轨迹,保证模型学会异常交互场景预测。

▲分割法与渲染法数据集优劣对比表

轻量化LoRA微调方案,无全量重训开销

基座14B视频大模型完整参数冻结,仅用秩256 LoRA分支微调掩码补全任务,8张H200 GPU训练约10000步,4天即可完成收敛。

训练损失仅采用视频重建损失,无需额外动作对齐损失,掩码区域作为条件不参与损失计算,仅约束灰色未知区域像素生成精度。训练完成后单权重文件无分支拆分,前向、逆向推理共享一套参数,不用维护两套模型权重。

三大下游标准化应用链路

微调完成的模型可直接接入机器人开发全流程,落地了三类工业可用场景:

  • 策略离线评估:

批量仿真机器人执行轨迹,用多模态大模型Gemini 3.1 Pro自动打分,不用真机反复试错磨损硬件,仿真成功率与真实机器人执行相关系数r=0.982,参考价值极高;

▲仿真与真实任务成功率相关性散点图

  • 基于模型规划(Best-of-N):

从扩散策略采样多条候选动作掩码,输入模型预判每条轨迹交互结果,筛选最优动作下发真机,RoboCasa全任务平均成功率提升7%~26%;

▲各类方法动作提取任务成功率柱状图

  • 逆向动作提取:

输入人类演示的物体运动掩码,模型生成对应机器人操作视频,搭配逆动力学模型输出可执行关节动作,无需专门逆向任务训练,零样本完成物体轨迹到机器人控制量转换。

02 横向定位:四类机器人视频世界路线对比

当前机器人视觉动作建模分为四条主流技术路线,从数据成本、双向建模、跨本体泛化、工程成本四个维度做客观横向对比:

  • 关节/骨架数值条件基线(Ctrl-World、VAP)

优势:动作向量存储空间小,训练代码成熟;

短板只能正向预测,跨本体生成机器人严重扭曲,更换夹爪、人形机器人性能暴跌,BEHAVIOR数据集PSNR仅18.39,同条件本文22.90,泛化差距明显。

▲不同视觉条件消融定量对比表

  • 单一机器人掩码方案(Mask2IV、BridgeV2W)

优势:像素对齐、单机器人精度高;

短板掩码只能固定机械臂实体,无法切换物体做逆向推理,一套模型仅适配单一机型,复用性差。

  • 文本引导视频世界模型

优势:通用性强、无需动作输入;

短板空间指代模糊,杂乱桌面环境容易混淆目标物体,无法精准控制精细抓取轨迹,不适合操作类机器人。

03 实验结果

实验分为消融对比、跨本体泛化、三大下游任务三块,全部采用DROID真实机器人、Robocasa仿真、BEHAVIOR人形机器人三类数据集,不单纯罗列指标,拆解数值背后实际工程意义。

验证掩码接口不可替代性

消融变量分为末端可视化、骨架可视化、本文掩码视觉动作三类,指标选用LPIPS(越小越好)、SSIM、PSNR(越大越好):

▲三类条件输入定性效果对比图

  • 训练集同机型DROID场景:三类方案指标差距不大,骨架 PSNR 22.74,本文 23.74,基线差距微小;
  • 同款机器人更换非标夹爪:骨架LPIPS升至0.169,本文仅0.148,稀疏条件出现明显精度衰减;
  • 未见过的人形双臂BEHAVIOR机器人:骨架 LPIPS 0.162,本文低至 0.123,PSNR 高出 3.51,泛化优势完全拉开。

指标局限:PSNR、LPIPS 仅衡量画面像素相似度,无法量化物理合理性;

骨架基线数值尚可,但人形机器人生成出现肢体穿插、悬浮等违背物理的画面,纸面高分不代表能用于真机规划。

跨本体零样本泛化测试

核心实验:全程未用人形机器人数据训练,直接输入双臂掩码做推演。

▲未见人形机器人仿真效果图

Ctrl-W、骨架基线生成人形机器人肢体错位、单臂膨胀变形;本文掩码方案完整还原双臂开门、搬运动作,物体接触、推拉交互无失真。

本质原因在于骨架、末端条件是机器人专属稀疏特征,掩码是通用像素运动表征,不绑定机器人结构,不受关节数量、外形约束。

下游任务定量表现

  • 策略评估:

仿真任务成功率与真机高度线性相关(r=0.982),但模型存在轻微乐观偏差,仿真打分普遍略高于真实机器人,仅能作为筛选参考,不能完全替代真机测试;

▲真实与仿真任务进度分布小提琴图

  • 模型规划:

随候选动作采样数量提升,任务成功率稳步上涨,N=10样本时平均成功率提升19%,证明模型能精准区分有效/无效操作轨迹;

  • 逆向动作提取:

仅靠正向训练权重零样本完成物体轨迹转机器人动作,RoboCasa咖啡摆放任务成功率90%,高于ACT、molVLA等传统模仿学习基线,无需单独训练逆向网络。

04 一套掩码输入自由切换两大核心功能

过去想要同时实现前向预测与逆运动求解,只能搭建两套独立网络,数据与算力成本翻倍。

Masked Visual Actions用像素掩码打通视频大模型与机器人交互的适配壁垒,用同一套掩码输入自由切换正向仿真、逆向动作生成两大核心功能。

大幅降低机器人数据采集成本:仅15小时虚实混合数据完成微调;

跨机器人通用仿真底座:单臂、定制夹爪、人形双臂不用重新训练;

逆向建模无需额外标注人类动作:直接从物体运动推导机器人操作。

该工作给通用机器人世界模型提供一条轻量化新思路:不用强行改造视频基座,只通过视觉掩码对齐动作与像素先验,就能低成本实现跨本体双向建模;后续若融合深度、激光输入,拓展移动底盘时序掩码,或将覆盖室内导航、户外巡检更多机器人品类。

Ref

参考论文:Masked Visual Actions for Unified World Modeling

论文链接:https://arxiv.org/pdf/2607.19343

项目主页:https://masked-visual-actions.github.io

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询