这项由香港浸会大学主导的研究,以预印本形式发布于2026年7月28日,论文编号为arXiv:2607.25236,有兴趣深入钻研的读者可通过该编号查阅完整原文。研究团队提出了一套名为VisualPatchWorld(简称VPW)的新框架,试图解决一个困扰机器人和人工智能研究者多年的老难题:如何让机器自动学会"这个世界是怎么运转的",并利用这种理解来做出更好的行动决策。
你有没有想过,当一个机器人要把桌上的积木推到目标位置时,它脑子里到底在想什么?它需要知道自己的手(推杆)推上积木之后,积木会如何移动,力气大了会怎样,角度不对又会怎样。这种对"世界运转方式"的内在理解,研究人员称之为"世界模型"。有了准确的世界模型,机器人就能在脑子里先演练各种方案,挑出最好的那个再真正动手——就像一个棋手在落子之前先在脑中推演几步棋一样。
在VPW出现之前,研究者主要有两条路可走。一条路是用神经网络来学习世界模型:喂给网络大量的视频和操作数据,让它在自己内部的"向量空间"里建立起对世界的理解。这条路的好处是可以从数据中自动学习,不需要人工编写规则;坏处是学到的东西藏在几百万个数字参数里,谁都看不懂,出了问题也没法修。另一条路是人工编写物理引擎:程序员直接把重力、摩擦力、碰撞规则等物理定律写成代码,机器人就按照这些规则行事。这条路的模型清晰可读,但每换一个新环境就得重新写一套,费时费力,根本无法大规模推广。
VPW走的是第三条路:让机器自动从观察数据中归纳出可执行的程序代码,把这段代码作为世界模型。这段代码既能像物理引擎一样清晰可读、可编辑,又能像神经网络一样从数据中自动生成。这个想法听起来有些神奇,接下来就一步步拆解它的实现方式。
一、世界模型究竟是什么,为什么重要
要理解VPW的价值,先得弄清楚世界模型在整个智能体系中扮演的角色。香港浸会大学的研究团队在论文中引用了斯坦福大学李飞飞博士2026年提出的一个框架:一个真正有用的世界模型,应当承担三项职责——渲染(能生成画面,告诉你世界看起来是什么样子)、模拟(能追踪状态,告诉你世界现在处于什么状态)以及规划(能评估行动,告诉你下一步该做什么)。
把这三项职责想象成一位经验丰富的厨师的内心戏:当他看到一锅汤(渲染),他能判断现在的火候和食材状态(模拟),然后决定是该加盐还是继续等(规划)。三者共用同一套对烹饪的理解,只是在不同场合发挥不同作用。对于机器人来说,这套"内心戏"就是世界模型。
现有的神经网络世界模型,比如谷歌DeepMind的Dreamer以及法国高等师范学院和Meta联合开发的LeWM,在"渲染"和粗略"规划"方面表现不错,但它们的内部逻辑完全不透明。一旦机器人做了一个糟糕的决定,你无法打开它的大脑看看哪里出了问题,只能重新收集数据、重新训练。另一边,手工编写的物理引擎像教科书里的公式一样清晰,改一行代码就能调整一个物理参数,但每个新环境都要从头写,成本极高。
VPW就是在这两种极端之间架起一座桥:自动生成的程序代码,既有神经网络的数据驱动能力,又有物理引擎的可读性和可编辑性。
二、VPW的核心思路:像侦探一样先判断案件类型,再收集细节证据
VPW的整个工作流程可以用一个侦探破案的比喻来理解。面对一起案件,聪明的侦探不会一上来就漫无目的地收集所有线索。他会先根据现场情况判断这是哪种类型的案件——谋杀、盗窃还是意外,然后才有针对性地深入调查。VPW做的事情与此如出一辙。
整个流程分为四个阶段,依次进行。第一阶段是"视觉抽象",把原始的像素画面变成结构化的文字描述,记录每个物体的位置、角度、速度,以及物体之间的距离和接触关系。第二阶段是"轨迹导出",把一段段的操作录像整理成"动作前状态—动作—动作后状态"的三元组记录,为后续学习准备好材料。第三阶段是最关键的"两级程序归纳",这正是侦探破案的核心环节。第四阶段是"规划验证",用学到的程序来指导实际控制,检验它是否真的好用。
第三阶段的"两级程序归纳"细分为两个子步骤。第一级叫"主动探测选结构",第二级叫"参数拟合定细节"。把这两步放在一起理解:第一级相当于侦探判断"这是谋杀案还是事故",第二级相当于确定嫌疑人之后收集指纹、足迹等具体证据。
第一级的工作方式非常聪明。面对一个新环境,VPW会主动向模拟器发出几个精心设计的"探测性动作",就像侦探在案发现场做几个小实验一样。比如,给机器人施加一个短暂的力,然后观察它是立刻停下(说明没有惯性,是"无记忆"的一阶系统)还是缓慢减速(说明有惯性,是"二阶PD控制"系统);再比如,让机器人靠近一个积木,观察积木是不是只有在接触时才会移动(接触驱动型)还是远距离也会有响应(动作驱动型)。通过这一系列短小精悍的探测实验,VPW可以在一个预先定义的小型假设库中选出最符合当前环境物理规律的"动力学草图"。在论文展示的推箱子任务中,这个假设库有三个相互独立的二元选择:机器人遵循PD控制还是无记忆控制、积木是准静态还是有动量、运动是接触驱动还是动作驱动,三者组合出八种可能的草图,主动探测会挑出最合适的那一种。
选定了草图之后,第二级就开始填充具体数值。就像侦探锁定嫌疑人后去核查他在案发时间的行踪,VPW把选定的草图实例化为一段带有未知常数的Python代码模板,然后在大量的操作轨迹数据上进行优化,找到让预测误差最小的那组参数。这里有一个重要细节:优化的目标不是让单步预测尽量准,而是让**多步连续预测**的累积误差尽量小。这个区别非常关键——就像一张地图,单步误差小只能说明每一格画得准确,但如果格与格之间有系统性的偏差,沿着这张地图走个十步,你可能已经偏离正确路径很远了。VPW专门针对"长距离导航"的需求来校准地图,而不仅仅追求每一步的精度。
三、把程序代码当作"脑内演练场"来规划行动
有了这段可执行的Python程序,机器人就可以用它来规划行动了。VPW采用的规划方法叫做"滚动时域模型预测控制"配合"交叉熵方法"(论文中简称CEM-MPC)。这个听起来复杂的名字,背后的逻辑其实相当直观。
考虑这样一个场景:你站在一个迷宫的起点,需要找到出口。你随机想出一百条不同的路线,然后在脑子里分别推演每条路线会走到哪里,挑出最接近出口的那些路线,再以这些好路线为模板,生成下一批更优化的路线候选,如此迭代几轮之后,你就能找到一条相当不错的路径。VPW的规划就是这么运作的,只不过推演路线用的是刚才学到的程序代码,而不是人的直觉。
更妙的是,VPW把"当前状态的观察"和"未来行动的评分"分成了两个独立的问题。观察当前状态时,VPW可以从真实图像中提取场景描述(工具路径),或者直接读取模拟器的精确状态(神谕路径);而评分未来行动时,用的是归纳出来的程序代码,不需要额外调用昂贵的物理引擎。这种分离设计让研究团队可以精确地测量"感知误差"和"动力学误差"各自对最终规划效果的贡献有多大。
论文还设计了一种"混合评分"机制来处理那些特别难搞的接触密集型任务。核心思路是:用归纳出来的程序先对全部候选方案进行粗筛,从中取出表现最好的前30%,再调用真实的物理引擎对这30%进行精细验证,最终从中选出最优方案。这样一来,物理引擎的调用次数比全程使用引擎减少了70%,但规划效果几乎没有损失。
四、在四个不同任务上的表现:哪里亮眼,哪里还差一口气
研究团队在LeWM基准测试的四个任务上对VPW进行了系统评估,每个任务各有特点,对世界模型的要求也各不相同。
推箱子任务(PushT)是最复杂的一个,要求机器人用圆形推杆把一个T形积木推到指定的位置和朝向。这个任务的难点在于接触力学:推杆和积木的接触点、接触角度、接触时机,都会影响积木的运动方式。VPW通过主动探测确认了这里适用"接触驱动PD控制加准静态积木"的物理草图,然后拟合出PD增益(KP约92、KV约26)和缩放参数等具体数值。仅靠归纳出来的程序做评分时,成功率达到22%;而此前所有代码型基线方法的成功率几乎为零。加上混合评分之后,成功率一跃升至88%到96%,接近使用真实物理引擎的96%天花板。
双房间导航任务(Two-room)要求机器人在有墙壁和门道的二维环境中导航到目标位置。VPW归纳出的是线性导航规律,在归纳程序评分下就达到了96%的成功率,与使用真实物理引擎的100%已经非常接近。混合评分进一步提升到100%。
积木操作任务(Cube)要求机械臂抓取并移动一个三维空间中的方块到目标位置。VPW归纳出"夹持触发型接触"规律,也就是只有在夹爪夹住积木的时候,积木才会跟着移动,否则保持静止。这个关键的"开关逻辑"让VPW的成功率达到86%,而此前表现最好的代码型基线WorldCoder只有74%。
机械臂到达任务(Reacher)要求控制一个双关节机械臂让指尖到达目标点。这个任务的关键在于运动学:机械臂的运动是在关节角度空间里发生的,而不是在指尖的笛卡尔坐标空间里。其他代码型方法普遍犯了一个错误,它们把指尖当作一个可以自由移动的质点来建模,忽略了关节运动的约束,导致预测误差极大(平均误差0.86),规划成功率只有6%到30%。VPW通过主动探测识别出这里应该用"关节空间动力学加正向运动学"的草图,拟合出关节角度更新矩阵和正向运动学参数,将预测误差压低到0.04,规划成功率提升到72%。
把四个任务放在一起看,VPW的平均成功率达到69%,比此前最好的代码型基线(POMDP-Coder,45.5%)高出23.5个百分点,比PatchWorld(43%)高出26个百分点。从图表数据中可以明显看出,在Reacher任务上VPW的开环预测误差曲线一路低平,而其他所有方法的误差曲线在前几步之后就开始急剧攀升,有些甚至出现几百像素级别的不稳定跳跃,这直观地说明了为什么"选对物理草图"会如此关键。
五、感知误差有多大影响:从像素到计划的损耗
一个自然而然的问题是:如果机器人不是靠读取模拟器的精确状态,而是靠识别真实图像来感知当前状态,效果会打多少折扣?VPW的设计专门为回答这个问题留了接口,通过对比"图像工具路径+归纳评分"和"神谕路径+归纳评分"两种条件,可以直接量化感知误差的代价。
从实验数据来看,图像工具路径在PushT任务上的位置误差仅为1.8像素,与神谕路径的1.9像素几乎持平,说明颜色分割加PCA方向估计这套计算机视觉管线对推箱子任务来说已经足够精确。在Reacher任务上,指尖和目标点的定位误差只有0.12个归一化单位,但整个手臂的关节角度估计误差较大(2.65个单位),因为从单张图像中恢复关节角度本就是个困难问题。在双房间导航任务中,图像工具路径恢复出的智能体位置误差仅为0.19个归一化单位,精度相当令人满意。
相比之下,如果用大型语言视觉模型(VLM)来提取场景信息,效果就差很多。VLM能正确识别出画面中有哪些物体、它们的相对位置关系是什么(比如"智能体在积木的左边"),但它给出的数值坐标严重失准,在PushT任务上的坐标误差高达236像素,是图像工具路径的130倍以上。这说明,语义理解和精确的空间定量描述是两码事,至少在当前的VLM能力水平下,前者不能替代后者。
这个发现对实际应用有直接意义:如果你想把VPW用在真实机器人上,搭配适当的计算机视觉处理模块(比如颜色分割、深度相机)是可行路径,但直接接一个通用VLM当作感知层还不够可靠。
六、还差什么:接触密集型任务的残差缺口
尽管VPW在多个任务上表现亮眼,研究团队在论文中也坦率地指出了它仍然不足的地方。核心问题集中在接触密集型任务,也就是推箱子(PushT)。
在这类任务中,成败往往取决于极短暂的接触时刻:推杆在正确的角度、正确的速度接触到积木,积木才会按预期方向滚动;稍有偏差,积木可能朝完全相反的方向运动。这种高度依赖接触时刻的特性,使得即使是相当准确的物理草图,在评分时也容易犯"差之毫厘,谬以千里"的错误——两个在归纳程序看来分数接近的候选方案,在真实引擎中可能一个成功、一个完全失败。
这是规划效果对单步预测精度"不单调"的典型情况:提高预测精度并不总能线性地提升规划成功率,因为在关键的接触时刻,任何微小的预测误差都会被后续的动力学放大。论文中有一个图表清晰地呈现了这一点:VPW归纳的积木运动预测(累积位移约16.2像素,真实值约140像素)比所有基线方法好得多,但相对于真实物理过程仍有明显差距。
混合评分机制正是为此而设计的解决方案。通过把评分分成两步——先用归纳程序粗筛出有希望的候选方案,再调用真实引擎精筛前30%——VPW把PushT任务的成功率从22%推到了88%(图像输入条件)或96%(精确状态输入条件),用30%的引擎调用次数换来了接近全程使用引擎的效果。这种"以程序做海选、以引擎做复赛"的策略,在计算效率和规划质量之间找到了一个务实的平衡点。
七、与其他方法的横向比较:各自擅长什么,各自缺少什么
论文在比较部分对当前主流方法做了相当全面的梳理,研究团队将其分为神经网络参考组和可执行代码比较组两个大类。
神经网络参考组包括LeWM、DINO-WM、PLDM等方法,它们在四个任务上的平均成功率在79.5%到85.8%之间,整体高于VPW的69%。但这个比较并不是苹果对苹果的公平比较——神经网络方法使用了原始图像作为全程输入(包括训练和评分),而VPW的主要比较基线是可执行代码组,两者的数据来源和使用方式不同。神经网络方法在已有大量标注数据的情况下表现优秀,但它们的动力学知识藏在参数里无法检视和修改,这是根本性的架构差异。
可执行代码比较组才是VPW真正的竞争对手。这个组包括六种不同的方法:PatchWorld通过反例引导搜索来合成Python代码;WorldCoder通过与环境交互来学习单体Python模型;POMDP-Coder用大语言模型归纳概率程序;PoE-World把多个专家程序加权组合;GIF-MCTS用蒙特卡洛树搜索在代码编辑空间中搜索;CWM-Game合成带有树搜索的代码世界模型。这些方法在四个任务上的平均成功率分别为43%、35%、45.5%、27%、23%和25%。
VPW在所有这些方法上都形成了优势,而且这些方法使用的是完全相同的训练数据(模拟器状态轨迹)、相同的规划设置(相同的起点终点、相同的CEM预算),唯一的区别是归纳出来的程序质量不同。这就使得实验结论相当干净:VPW的优势不来自于数据优势或计算预算优势,而是来自于两级归纳流程对物理结构的更准确还原。
最能说明问题的是Reacher任务上的失败案例分析。PatchWorld和WorldCoder把机械臂的运动建模为"指尖在二维平面上自由移动",完全没有考虑关节运动约束,导致指尖的预测轨迹在几步之后就完全偏离真实轨迹。VPW通过主动探测识别出关节空间动力学的本质,用关节角度更新矩阵加正向运动学的方式建模,预测误差低了一个数量级,规划成功率也从个位数跳升到72%。这个对比案例非常直观地说明了"选对物理结构"比"代码写得多精巧"重要得多。
八、VPW的局限与未来方向
研究团队在论文结尾部分没有回避这套方法的局限性。
第一个局限是当前的假设库是人工预先设计的,每个环境需要人类专家提前指定几种可能的物理动力学类型(比如"接触驱动还是动作驱动")。这个假设库的设计需要对目标领域有一定的先验知识,自动化程度还不够高。扩大假设库、让VPW能处理更广泛的物理现象,是未来工作的重要方向。
第二个局限是整个系统的动力学学习依赖于模拟器状态数据(精确的位置、速度等),而不是直接从原始图像端到端学习。当前的图像视觉工具路径是一个针对特定环境设计的专用感知模块,而不是通用的视觉感知系统。论文提出,未来工作的一个重要目标是实现从视觉场景图轨迹直接进行端到端的程序归纳,进一步降低对专用感知模块的依赖。
第三个局限是评估仅在模拟环境中进行,尚未在真实机器人上部署测试。从模拟到现实的迁移通常会带来新的挑战,比如传感器噪声、执行器延迟、物理参数偏差等,这些都需要后续工作来解决。
归根结底,这项工作最大的贡献不仅仅是在四个基准任务上提升了几十个百分点的成功率,更在于提出了一条有理论依据的路线图:通过把"选什么物理结构"和"确定具体参数"分成两个清晰的步骤,可以自动地从交互轨迹中生成既可读又可用的代码世界模型。这种方法的可解释性意味着,当机器人做了一个错误决策时,研究人员可以直接审查是哪一段代码出了问题,然后有针对性地修正,而不是面对一个黑盒子束手无策。
说到底,VPW想做的事情很朴素:让机器人像人一样,在动手之前先在脑子里把事情想清楚,而且这个"想清楚"的过程是用人能读懂的语言写出来的,而不是埋在几亿个浮点数里。这个目标听起来理所当然,实现起来却并不简单——而VPW为此迈出了相当扎实的一步。感兴趣的读者可以通过arXiv编号2607.25236查阅完整论文,或者访问论文中公开的代码仓库进行复现实验。
Q&A
Q1:VisualPatchWorld与普通神经网络世界模型相比,最核心的区别是什么?
A:VisualPatchWorld把世界动力学表示为可执行的Python程序,而不是藏在神经网络参数里的数字向量。这意味着当机器人预测出错时,可以直接检查哪段代码有问题并加以修改;而神经网络方法出错时,只能重新收集数据重新训练,无法直接定位和修复具体的逻辑错误。
Q2:VPW的主动探测是怎么工作的,为什么不直接学习参数?
A:主动探测是VPW先向模拟器发出几个精心设计的短小实验动作,观察结果后判断当前环境属于哪种物理类型(比如有没有惯性、接触是否触发运动等)。直接学参数的问题在于,如果一开始就选错了物理结构(比如把有关节约束的机械臂当成自由质点来建模),再怎么优化参数效果也很差。先确定对的结构类型,再拟合具体数值,这两步分开做比直接混在一起学要可靠得多。
Q3:混合评分机制的70%节省是怎么计算出来的?
A:在标准的全引擎CEM规划中,每一轮迭代需要对全部N个候选方案都调用一次真实物理引擎,共需N次引擎调用。混合评分先用归纳程序对全部N个方案评分(不调用引擎),再只对评分前30%的方案调用引擎复核,也就是只需0.3N次引擎调用。相比全程使用引擎的N次调用,节省了70%的引擎调用次数,但规划成功率几乎不受影响。