☰
世界模型开始选择“该预测什么”
2026/10/8 8:30:23 网站建设 项目流程

世界模型开始选择“该预测什么”

EMBODIED INTELLIGENCE · WEEKLY REVIEW

本周一句话

预测开始为动作选择信息,控制开始为延迟设计反馈,产业则将泛化演示、安全协作与实际交付逐项对齐。

01

产业脉动

01

Figure:Helix 2.5 走进 30 个未见家庭

2026-09-17|模型与真机演示公开

Figure 展示Helix 2.5 在旧金山湾区 30 个未见家庭中执行整理房间、叠毛巾和铺床。任务策略基于共同的 Index 预训练基础,未使用这些家庭的专门采集或微调;在其受控实验中,Index 预训练使完整任务成功率从 9% 提高到 56%。这批结果聚焦三类家务及公司报告的测试协议,展示的是模型泛化与真机演示能力,家庭服务的规模化交付仍需另看运营数据。

来源|https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization

02

Agility:Digit 5 将安全协作与维护节奏纳入产品设计

2026-09-15|新产品公布,计划 2027 年交付

Agility 公布第五代 Digit,标称载荷 22.7 千克、运行 90 分钟后充电 9 分钟,并以 AI 人员检测、独立安全控制器和 NVIDIA IGX Thor 相关计算平台支撑协作场景。早期体验计划安排在 2027 年上半年,全面供货预计在当年年底。安全设计与仍在发展的行业标准共同演进,具体使用仍取决于部署环境和风险评估;公司公布的上一代运行积累应与新产品的交付进度分别理解。

来源|https://www.agilityrobotics.com/content/agility-unveils-digit-5-humanoid-robot-built-for-cooperatively-safe-work-at-scale

03

极智嘉:欧洲创新实验室连接模型展示与客户验证

2026-09-16|杜塞尔多夫实验室开放

极智嘉在德国杜塞尔多夫开设欧洲创新实验室,展示 Gravity 具身智能框架、Gino 1、RoboShuttle Hyper 与机器人拣选工作站。实验室面向欧洲客户和合作伙伴开展端到端方案演示、测试与验证。产业价值在于把算法、仓储系统和现场工作流程放在共同的验证空间;实验室揭幕本身并不提供这些新方案的量产规模或客户长期运行指标。

来源|https://www.geekplus.com/resources/news/geekplus-opens-european-innovation-lab-in-d%C3%BCsseldorf-to-accelerate-ai-driven-robotics-across-europe?hs_amp=true

04

Planted Solar:3,180 万美元融资支持机器人建造能源设施

2026-09-15|B 轮融资公布,Sage 计划年内现场推出

Planted Solar 宣布完成 3,180 万美元 B 轮融资,由 Piva Capital 与 RA Capital 的 Planetary Health 团队共同领投,资金用于扩大机器人机队及推进自动化电站部署。公司称,一项面向数据中心的 28 兆瓦项目从首次沟通到供电用时 10 个月,其中现场建设不足 3 个月;Sage 机器人计划在 2026 年底前现场推出。项目进度来自公司披露,融资规模、已有项目与新机器人的未来部署时间应分别看待。

来源|https://www.plantedsolar.com/blog/planted-series-b-funding-autonomous-power-deployment

05

NSF:将物理系统 AI 纳入 X-Labs 新一批方向

2026-09-16|资助方向与申请机会公开

美国国家科学基金会在 X-Labs 计划中新增 AI for Physical Systems 等方向,覆盖先进传感、机器人、具身交互与信息物理系统。其组织方式强调跨领域团队、可扩展平台技术和阶段性里程碑,为算法与真实物理系统共同验证提供资助入口。这次公告公布的是研究方向与申请机会,具体项目的获资助主体、金额和实施结果要以之后的授予记录为准。

来源|https://www.nsf.gov/tip/updates/nsf-announces-3-additional-topics-part-nsf-x-labs-initiative

06

MMI:1,700 万欧元联合投资支持显微外科机器人

2026-09-16|联合投资公告公开

Angelini Ventures 与欧洲投资银行公布对 Medical Microinstruments 的 1,700 万欧元联合投资,支持 Symani 显微外科机器人平台。这是双方此前建立的 1.5 亿欧元合作框架下的第三笔联合投资。该事件反映医疗机器人持续获得产业与公共金融支持,公告中的融资用途与商业推进应和临床效果、监管批准及医院实际装机分别核验。

来源|https://www.angeliniventures.com/insights-and-news/mmi-investment/

02

研究专题

本期阅读涵盖 9 月 14—20 日的 20 篇研究,日期采用北京时间的 arXiv 首次提交日期。以下按五条问题线索整理,并将每篇论文与对应原文图 1 一一匹配。

01

世界预测开始选择“该预测什么”

从因子化潜变量到选择性未来模态,预测表示正被重新约束为任务真正需要的接口。

PAPER 01 / 20ARXIV 2609.20800

JEPA-Anything: Learning Predictive Models across Different Worlds

预测目标

世界模型是否必须生成完整未来图像?JEPA-Anything 将预测目标分解为正交、互补的潜在因子,让同一套预测学习跨越不同世界与动力学结构。

关键结果

在匹配的 JEPA 对照中,它改善了全部 10 项动力学任务;规划收益仍随环境而变,说明表征质量与闭环价值需要分别检验。

— JEPA-Anything: Learning Predictive Models across Different Worlds 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.20800

PAPER 02 / 20ARXIV 2609.17524

Modality-Autoregressive World-Action Models

模态选择

ModAR 围绕机器人控制选择未来模态:先预测点轨迹、DINO 特征与深度,再自回归生成动作,而不是默认把未来 RGB 当作唯一目标。

关键结果

三项双臂任务平均成功率达到 83.3%;未来 RGB 在所测条件下没有提供一致增益。

— Modality-Autoregressive World-Action Models 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.17524

PAPER 03 / 20ARXIV 2609.16074

World-Action Models for Robot Learning and Control: A Survey

比较坐标

WAM Survey 从表示、状态转移、动作接口、架构与训练流程五个维度组织世界动作模型,为不同技术路线提供统一比较坐标。

关键结果

这是一篇综述,不以单一成功率为结论;评估时应把画面质量、动作信息保留、闭环成功率与计算预算放在同一张表中。

— World-Action Models for Robot Learning and Control: A Survey 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.16074

PAPER 04 / 20ARXIV 2609.17372

XPACE: Joint World and Action Modeling from Heterogeneous Experience

联合建模

XPACE 让共享视频骨干同时服务世界动作策略和动作条件模拟器,并生成偏离—恢复轨迹,把预测模型也作为后训练数据来源。

关键结果

在恢复数据实验中,成功率从 61.7% 提高到 86.7%。

— XPACE: Joint World and Action Modeling from Heterogeneous Experience 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.17372

PAPER 05 / 20ARXIV 2609.15870

WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics

监督层级

WLA³ 以局部潜在动作连接动力学与本体执行,同时用片段聚合特征监督语义模型,把语义、动力学与运动学装入同一训练流程。

关键结果

论文在六项真机任务上报告 81.9% 的平均成功率。

— WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.15870

02

慢模型与快反馈如何共存

大型策略保留任务先验,轻量模块负责及时反应;延迟本身开始进入训练目标。

PAPER 06 / 20ARXIV 2609.18207

Reinforcement Learning for Real-Time Vision-Language-Action Policies

实时编辑

Real-Time EXPO-FT 让 VLA 异步提出动作块,再由编辑策略依据新观测修正,并通过强化学习对齐动作内容与执行时序。

关键结果

四项动态真机任务在最多 10 分钟在线数据下,平均表现由约 42% 升至 97%。

— Reinforcement Learning for Real-Time Vision-Language-Action Policies 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.18207

PAPER 07 / 20ARXIV 2609.18242

ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation

力觉修正

ForceDelta-VLA 从力条件教师蒸馏局部动作修正,让大型策略保留任务先验,同时由快速学生策略响应接触变化。

关键结果

九项任务平均成功率为 82.2%,并降低了成功试验中的峰值接触力。

— ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.18242

PAPER 08 / 20ARXIV 2609.15570

DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models

单步蒸馏

DIDO 把交互、物体和夹爪信息纳入单步蒸馏,试图从预测模型内部减少多步去噪带来的等待。

关键结果

在 H100 设置中,端到端延迟从四步教师的 562 毫秒降至 384 毫秒;压缩为单步的是世界模型部分。

— DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.15570

PAPER 09 / 20ARXIV 2609.20761

Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control

多时间尺度

Agile-WAM 让视觉预测较长未来,而触觉只预测紧邻下一帧,用不同时间尺度匹配视觉与接触反馈的变化速度。

关键结果

论文在九项仿真与五项真机任务中检验设计,并报告真机总体成功率相对最强对照提升 29.4%。

— Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.20761

03

全身能力的关键是先验与接口

跨本体共享运动语义,与保留接触和执行约束,并不是互相排斥的选择。

PAPER 10 / 20ARXIV 2609.16644

WholeBodyWAM: Generalizing Pre-trained World-Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination

控制接口

这版 WholeBodyWAM 从已有操作 WAM 出发,以统一全身控制接口 UWBC 和协调感知注意力 CASA 连接步行与上肢操作。

关键结果

在 SONIC 仿真配置下达到 91.9% 总体成功率,并展示真实 G1 的分布外任务进度。

— WholeBodyWAM: Generalizing Pre-trained World-Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.16644

PAPER 11 / 20ARXIV 2609.18197

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

运动先验

另一版 WholeBodyWAM 先用 UniMotion-4K 的 4,100 多小时运动训练 Motion Expert,再联合视频与动作专家学习全身世界动作模型。

关键结果

天工 3.0 六项任务平均得分为 72.2%。两篇同名工作证据与技术入口不同,需要分开阅读。

— WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.18197

PAPER 12 / 20ARXIV 2609.15213

X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control

跨本体基础模型

X-WBC 把共享命令标记与本体专用编码器、解码器结合,让不同人形机器人共享高层运动语义并保留各自的执行映射。

关键结果

模型在九种仿真机器人上联合训练,并展示四种真实人形机器人的 VR 控制。

— X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.15213

PAPER 13 / 20ARXIV 2609.16683

Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions

接触与手指协调

Weave 把物体接触、手指协调与全身移动操作放进统一策略,并从带物体的人类交互中学习执行先验。

关键结果

仿真训练交互成功率为 92.5%,未见交互序列为 65.0%,同时形成约 9,000 条带接触标注的执行轨迹。

— Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.16683

04

灵巧操作从接触预测走到后训练

一端扩充跨域接触知识,另一端压缩高自由度动作空间,二者共同指向更可控的真实执行。

PAPER 14 / 20ARXIV 2609.20649

DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation

触觉世界模型

DexTouch-WM 用兼容的人类与机器人全手触觉布局作为数据桥梁,以视频专家连接轻量触觉专家,探索触觉预测的跨域扩展。

关键结果

固定五小时机器人数据、增加到 100 小时人类数据后,机器人域 Contact-IoU 从 0.415 升至 0.588;合成轨迹训练策略仍弱于对应全真实数据配置。

— DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.20649

PAPER 15 / 20ARXIV 2609.19666

Towards High-DoF Dexterous Manipulation through VLA Post-Training

高自由度后训练

Dexterous Post-Training 把每手 20 维动作压缩到 9 维潜在空间,再依次接入监督微调、DAgger 与潜在残差强化学习。

关键结果

双臂平台五项任务在完成相应后训练后各进行 20 次评估,均取得成功。

— Towards High-DoF Dexterous Manipulation through VLA Post-Training 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.19666

05

数据、上下文与工程接口共同影响适应能力

从现场上下文、针对性采集到表征对齐和工程平台,适应能力越来越像一条完整的数据—训练—部署链路。

PAPER 16 / 20ARXIV 2609.19138

In-Context Robot Learning with VLM Agents

现场上下文

GPT-Policy 用上下文编译器把示范关键转变、机器人动作工具与执行反馈连接起来,在不更新参数时适应新任务。

关键结果

人类视频能改善部分真实操作,但各条件试验量较小,抓取与完成状态判断仍有失败。

— In-Context Robot Learning with VLM Agents 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.19138

PAPER 17 / 20ARXIV 2609.20659

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

针对性采集

HIL-UMI 把策略分歧与进度反馈带到手持采集端,让补充数据更靠近当前策略真正困难的状态。

关键结果

它关注的是人机协同后训练的数据效率,而不是单纯扩大无差别示范规模。

— HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.20659

PAPER 18 / 20ARXIV 2609.18232

UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data

中间域对齐

UMI-Bridge 借助有动作标注的中间域,对齐人类与机器人经验,使跨本体数据共享由视觉相似转向动作锚定。

关键结果

论文在三项真机任务上获得 91.7% 的平均成功率。

— UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.18232

PAPER 19 / 20ARXIV 2609.18514

ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware

主动视角

ActiveScale 把相机位姿与历史视频纳入动作学习,并用 1,000 小时人类—机器人中期训练支持遮挡搜索及视野外操作。

关键结果

工作把主动感知同时扩展到模型、数据和硬件,重点检验机器人是否会主动改变视角以补足信息。

— ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.18514

PAPER 20 / 20ARXIV 2609.17210

FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence

工程平台

FluxVLA Engine 统一数据转换、配置、分布式训练、评测与部署接口,降低 VLA 方法从研究复现到迭代上线的工程断点。

关键结果

官方仓库提供代码与运行配置;能否复用仍取决于数据时间语义和控制接口的一致性。

— FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence 的核心框架|来源:论文图 1

来源|https://arxiv.org/abs/2609.17210

03

值得继续讨论

1

在相同延迟与算力预算下,因子化预测、选择性模态生成和轻量反馈各能贡献多少闭环收益?

2

如何在统一协议中比较全身任务进度、运动跟踪成功与完整操作成功,并分清仿真和真机证据?

3

触觉预测、人类数据和针对性纠正能否组成可量化收益的后训练闭环?

4

当产品进入家庭、仓储和医疗场景,哪些长期运行、维护与安全指标应与单次演示同时公开?

END

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询