如果你把感知、记忆、推理三个词放进一份世界模型评测表里,会看到相当不错的成绩:图像重建误差在下降,视频预测做得有模有样,多步推理也能给出完整链条。但把“动机”和“元认知”放进同一张表,情况就急转直下——大多数模型在这两个维度上要么没有对应能力,要么评测时根本找不到可操作的指标。我见过不少团队把世界模型 demo 跑得很漂亮,可一旦追问“模型为什么主动去探索这个方向”“模型知不知道自己没见过这种场景”,场面往往会冷下来。
这不是某个模型的个案,而是整个评测方法学的问题。下面要拆的验货思路不是权威标准,而是一次完整的评测实践记录:该用哪些维度、哪些任务、哪些指标,以及为什么前三维容易及格、后两维几乎全军覆没。如果你正在做世界模型评测、大模型 Agent 能力分析,或者只是想搞清楚“世界模型到底靠不靠谱”,这篇内容会给你一条可复用的检查路径。
1. 先弄清楚要给什么样的“世界模型”验货
1.1 世界模型在四个场景里长相完全不同
“世界模型”这个词在不同圈子里,指的根本不是同一个东西,甚至评测方式也完全对不上。
在自动驾驶里,世界模型通常指感知周围环境、预测下一时刻交通状态、再输出驾驶决策的联合模型。在具身智能里,它指机器人通过视觉和触觉信息建立物理空间的内部表征,用来规划抓取和移动。在视频生成里,世界模型被理解成“能生成符合物理规律的新视频”的模型。在强化学习和游戏 AI 里,世界模型又往往是一个环境的隐式模拟器,用来在想象中做规划。
这几种场景有一个共同点:都要求模型不只是识别输入,而是对环境的演化做出预判。但它们的评测任务差别很大。验货之前,必须先把对象定义清楚,否则就会出现“这边感知分数很高,那边却说世界模型全是炒作”的互相打脸。
我一般会先把模型按输入和输出格式分成三类:
- 输入感知数据、输出预测或插帧的“感知预测型”。
- 输入历史状态、输出动作决策的“决策规划型”。
- 输入文字或图片描述、生成未来画面的“生成模拟型”。
每一类能验的内容完全不同。所谓给世界模型验货,第一步是确认你手里拿的到底是哪一类货,而不是拿自动驾驶的标准去验视频生成模型。
1.2 五维验货清单是怎么来的
选定对象之后,再谈能力维度。这里用五个维度:感知、记忆、推理、动机、元认知。
前三个维度是传统 AI 能力评估的常客,有相对成熟的测试方法和公开基准,所以容易做到“及格”。后两个维度涉及模型的内部驱动力和自我认知,目前既缺少公认评测任务,又缺少稳定可计算的指标,所以大多数模型在这两项上可以被判定为“能力缺失或评测缺失”。
这个五维清单并不是要包揽世界模型的全部能力。它更像一个诊断框架:先看模型能不能获取信息(感知),能不能保存信息(记忆),能不能利用信息做推断(推理),再看它有没有主动选择目标的能力(动机),以及它能不能感知自身认知状态的边界(元认知)。前三维解决“模型能不能做事”,后两维回答“模型为什么做这件事、做错时知不知道自己做错了”。
把这个问题想清楚之后,后面所有评测任务的选择才有依据。下面按这个框架逐一拆解。
2. 感知能及格,但别把分数当成理解
2.1 感知评测有标准答案,这是先天的优势
感知是整个评测体系里最容易拿分的项目。
原因并不复杂:感知任务有相对明确的答案。图像分类有标签,目标检测有边界框,视频预测有下一帧作为标准答案,多模态对齐可以用检索命中率来算。模型输出的结果可以和某个基准直接比对,分数算出来之后,至少在统计意义上是可复现的。评测者不需要太多猜测模型“有没有理解”,只需要看预测误差和正确率。
这也是为什么很多世界模型项目对外展示时,第一个放出来的往往都是感知结果:让人看到模型能重建出清晰画面、能识别障碍物、能把点云和相机图像对齐。这类 demo 最容易打动观众,也确实能反映一部分基础能力。
但这里有一个默认前提:训练分布内的感知是及格线,不等于开放世界里的感知都及格。我在评测时会专门加两类额外测试,一类是往输入里加入对抗噪声或遮挡,看模型的预测是否剧烈变化;一类是故意输入训练分布之外的场景,看模型有没有“硬猜”而不是如实报错。很多模型在标准评测集上能到 90% 以上,一到分布外测试就明显退化。所以感知的“及格”要打引号:准确率高不等于理解了物理世界。
2.2 物理一致性和分布外输入才是真正的考题
感知评测的第二个问题,是容易出现“像素级正确、物理级错误”。
一个视频预测模型可以把下一帧的画面重建得非常清晰,但仔细看物体运动可能违反重力、碰撞可能没有阻挡关系、光影变化不符合光源方向。这些错误在逐帧像素误差上暴露不出来,因为像素差异很小,但物理一致性是彻底的失败。
所以建议在感知评测里加入“物理一致性抽检”:把预测出的连续几帧播放出来,让人或规则检查三个维度——遮挡关系是否保持,运动轨迹是否连续,交互之后的状态是否合理。例如一个物体被推到桌边的过程中,它是先悬空再下坠,还是一直贴着桌面移动;两个物体碰撞后,是否发生了合理的方向变化。不要只看重建误差。
如果目标是自动驾驶或机器人场景,还建议加入恶劣天气和光照变化的测试输入,经典的路测本身就是这种抽检的简化版。感知的验货结论应该是:在受控条件下有用,在开放世界里只能算候选能力,不能直接当作“理解”来宣传。
3. 记忆能及格,但很多时候是“看起来记住了”
3.1 三种记忆类型必须分开测
记忆评测比感知更讲究任务设计。不同记忆类型对世界模型的意义完全不同。
第一种是工作记忆,对应模型在单次交互过程中维持当前状态的能力。比如视频里有一段长镜头,模型要记住物体之间的相对位置,预测后面几帧时才不会错乱。评测方式通常是状态追踪任务:让模型读完一段序列,回答一个需要跨帧整合的问题。
第二种是长期记忆,对应跨会话、跨任务的知识保存能力。Agent 记忆、双网络记忆模型、记忆引擎这类方向都在解决这个问题。评测方式是给模型一批历史经验,间隔若干轮任务后,看它能否调用之前的信息完成当前任务。
第三种是场景一致性记忆,也是世界模型最核心的记忆能力:模型必须记住一个物理场景里的主体、遮挡、属性和变化历史,并在之后的决策中持续保持一致。比如机器人先看到一个杯子在桌上,然后机器人转动视角,模型应该知道杯子还在原来的大致位置;如果杯子被移动,模型要能更新它的状态。
3.2 记忆评测最常见的三个坑
记忆评测很容易出现假象。第一个坑是“局部提示作弊”:表面上模型在回答需要记忆的问题,实际上问题里的语境词已经包含了足够线索,模型不需要真正回忆起之前的完整历史。我见过不少长上下文评测集,正确答案其实可以通过上下文共现猜出来。所以记忆任务必须设计成“只有保持完整状态才能答对”的形态。
第二个坑是“记忆时间窗口太短”。有些记忆评测只在一个 episode 内做状态追迹,时间跨度不到几十步,这种任务只要模型有足够大的上下文窗口就能蒙混。真正能看出记忆能力的,是跨 episode、跨会话、输入被截断或压缩之后仍然能保持关键状态。
第三个坑是“记忆与推理混在一起评”。当任务要求模型记住一段规则再推出答案时,我们很难区分得了分是因为记忆好,还是推理能力强。评测时要分离变量:要么给足提示,只测记忆;要么禁止利用上下文,只测推理。混在一起跑出来的分数,参考意义很低。
所以“记忆及格”是个很粗糙的判断。按我的标准,至少要做到跨 session 状态保持、被干扰后仍能恢复、并且能把记忆转化成动作输出,才能真正算过关。当前的模型中,很多只能满足其中一个条件,谈不上完整的世界记忆能力。
4. 推理能及格,前提是题目已经给了完整约束
4.1 从单步推理到多步因果推理
推理评测是最热闹的赛道之一。思维链、QBF 推理、视觉推理、图形推理、大模型推理优化,每一类都有人在做。之所以推理能及格,是因为推理任务通常给出了足够明确的约束:题目里告诉你有几个对象、对象的属性、它们之间的规则,模型只需要按照规则一步步推导。
这种“给定前提,求结论”的推理,模型是可以学会的。神经网络擅长模式匹配,逻辑链条只要在训练分布里出现过足够多次,模型就能复现。所以在标准推理基准上拿到高正确率,并不意外。但世界模型真正需要的推理,往往面临另一类问题:前提不完整。
在物理世界或开放任务里,模型面对的是大量未知信息。一道题说“这里有一个箱子,可能装了东西”,模型不知道该往哪个方向推。一个机器人进入房间,不知道哪个抽屉可以打开。这种“自主找前提”的推理难度,远高于“按给定条件推导”。
评测推理能力时要特别注意这两者的区分。我的做法是加一组“前提缺失题”:给模型一个场景,隐去其中一个关键条件,看模型是会提出疑问、做出合理假设,还是直接凭空补一个条件继续推。绝大多数模型会选择后者,这就是推理分数虚高的重要原因。
4.2 评测推理要看错误结构,而不是只看准确率
只看正确率会掩盖很多问题。两个模型可能都答对了 80% 的题目,但一个的错误集中在“假设前提错误”,另一个的错误是“计算过程中某一步错”,它们的可用性完全不同。
我在评测里会记录错误分布:答错时是第一步就错,还是最后一步错;是错误的因果归因,还是算术失误;是不知道规则,还是不会把规则应用到新场景。这个错误结构比总正确率更有诊断价值。
另外要关注一步到位的推理与多次修正的推理。模型能否在发现中间结果不合理时回溯并调整方向。目前很多推理模型是“一条路走到黑”,错了就继续错到底,缺乏回溯搜索能力。这种情况在多步因果推理里尤其明显。推理维度的结论是:受控任务里能及格,开放场景下还非常不成熟,评测时一定要拆开看错误类型。
5. 动机几乎全军覆没:因为没有任何模型有真正的内在动机
5.1 目标函数、奖励信号和动机不是一回事
动机评测的难点,首先在于概念本身。一个强化学习智能体有奖励函数,一个对话模型有用户意图优化目标,一个探索机器人的环境中设置了好奇心系数,但这些都不是“动机”。
动机指的是模型在没有外部指令的情况下,仍然会主动选择某个方向行动的内部驱动力。在人类身上,它表现为好奇心、成就欲、规避危险等内在倾向。对世界模型来说,动机意味着:在模型主动与环境交互时,它选择探索哪个区域、尝试哪个动作、维持哪个目标的依据,必须来自模型自身状态,而不是直接来自训练标签或每一步的外部奖励。
目前绝大多数模型是“被动的任务执行器”:你给它一张图,它预测下一帧;你给它一个任务目标,它尽力完成。如果没人给它任务,它不会主动产生“我要去看看那个角落发生了什么”的行为。从严格意义上讲,这就是动机能力全失。
5.2 可观察的代理指标:探索权重的选择
自动化评测动机很难,但可以通过观察行为序列来判断。我建议采用三个代理指标:
- 探索行为:面对多个可选动作时,模型是否倾向于尝试信息增益更高的动作,而不是只选择即时回报最高的动作。
- 目标保持:在长任务中,遇到干扰事件时,模型能否回到原有目标,而不是被无关信号带走。
- 选项偏好一致性:模型在没有明确奖励差异的情况下,会不会形成稳定的偏好顺序,且这个偏好是否有助于任务完成。
三个代理指标只能说明“看起来有动机”,不能证明内部状态真的存在动机。评测时要在固定环境里跑多条轨迹,统计探索频率和决策切换情况,不能只给一次交互就打分。一个只有奖励函数、没有内在状态的模型,在这些指标上通常表现为“只选最快得分路径、遇到失败就原地打转、不会主动尝试变体”。这基本是全军覆没的状态。
5.3 动机评测为什么很难自动化
动机评测难自动化,还有一个现实原因:评估者预设太多。
给模型一段开放环境视频,人类会觉得“模型应该主动观察未知物体”。但机器并没有这种预设。要让评测可量化,就必须先定义“主动”的粒度:多久没动作算被动,选择哪个动作算主动,探索频率多高算动机强。这些阈值一旦定死,就越过“模型是否有动机”这个本质,变成“模型的参数是否适合某个阈值设定”。这也是为什么大多数世界模型评测根本不列动机这一栏。
6. 元认知几乎全军覆没:模型不知道“自己不知道”
6.1 信心校准是第一个能算出来的指标
元认知评测里相对可计算的是信心校准:模型对自己输出的置信度,和它实际答对的概率是不是一致。如果模型说“我有 90% 把握”的时候,真实正确率只有 60%,说明它严重高估自己,元认知能力不足。
具体评测方式不算复杂:让模型针对一系列任务给出答案,同时输出置信度分数;再把置信度分桶统计,看每个桶内的实际正确率。一个理想模型应该满足:置信度 80% 的答案约等于 80% 正确。当前大模型和世界模型普遍存在的问题是:答案越像训练数据中的常见模式,模型越自信;一旦输入是长尾场景、低频率事件,模型甚至意识不到自己进入了陌生的分布,仍然给出很高的置信度。
实际测试中,信心校准曲线会呈现明显的倒挂:越难的样本,置信度可能越高。这种情况比低准确率更危险,因为下游系统在采用模型输出时,无法区分哪些结果是可靠的。
6.2 错误觉察与策略切换
信心校准只能说明“模型是否知道答案可靠”,还不足以覆盖元认知的全部。真正的元认知还包含错误觉察和策略切换。
错误觉察的任务可以这样设计:让模型完成一个推理任务后,故意追问“你确定吗?请重新检查你的步骤”,观察它能否发现之前的错误并修正。这里特别要注意:如果模型因为被追问就盲目换答案,即使最后改对,也不是元认知,只是服从指令。只有模型能定位到具体错误步骤、解释为什么错、并选择新策略,才算有元认知能力。
策略切换更难测。模型面对一道不擅长的任务时,能否主动改变方法,而不是继续沿用旧方法。例如视觉推理题能通过画辅助线解决,文字模型不具备画图能力,它是否知道自己需要转换成更结构化的表示。目前大多数模型做不到这一点,原因是它们没有“自己的认知状态”这样一个可操作对象。它们的自我反思能力,来自训练过程中被指令对齐出来的外部行为,并不是对自身推理过程的真实监控。
6.3 给元认知设计压力测试任务
我给元认知验货时,会用三组压力测试:
- 分布外问题:故意问一个与训练主题完全不同的问题,看模型是否会立刻给出模糊回答,还是会坦然承认不熟悉。
- 无解问题:设计一个问题,内容里包含矛盾条件,看模型能否察觉这题无解,而不是硬凑一个答案。
- 输出来源测试:让模型判断某个答案是基于推理还是基于记忆,看它能不能区分自己是从知识库检索而来,还是现场推导而来。
这三组任务目前没有统一评分标准,但跑完之后很容易形成结论:模型大多数情况会把“不知道”伪装成“知道”,把“记忆输出”说成“推理结论”。这说明它们的元认知能力不是差一点,而是整体上还没长出这个功能。
7. 一份可以直接用的“验货”流程
7.1 五维度任务与指标速查表
如果你要动手验一个世界模型,我建议不要从头设计所有评测任务,先按下面这张表做减法。表格给的是任务、核心指标、及格判断和常见坑,实际跑的时候可以按模型类型删减。
| 能力维度 | 建议评测任务 | 核心指标 | 及格判断 | 常见坑 |
|---|---|---|---|---|
| 感知 | 图像重建、视频预测、多模态对齐、物理一致性抽检 | 重建误差、预测准确率、遮挡关系保持 | 标准集上结果稳定,且分布外输入不会剧烈退化 | 只看像素误差,忽略物理一致性 |
| 记忆 | 状态追踪、跨会话调用、压缩后恢复 | 跨步正确率、干扰后恢复率 | 跨会话仍能维持关键状态,小样本演示能复现 | 局部提示作弊;时间窗口太短 |
| 推理 | 单步逻辑题、多步因果推理、前提缺失题 | 正确率、错误结构、回溯修正能力 | 不仅正确率高,且错误不是集中在前提假设错误上 | 尝试重试或测试集刷题导致虚高 |
| 动机 | 开放探索轨迹、目标保持、选项偏好一致性 | 探索频率、目标恢复率、偏好一致性 | 无外部指令时仍出现稳定的探索行为 | 把奖励函数或好奇心系数当作动机 |
| 元认知 | 信心校准、错误觉察、分布外自报 | 置信度-实际正确率校准曲线、错误定位率 | 置信度与正确率达到可接受一致性,能主动承认未知 | 把“被追问后改答案”当成元认知 |
这张表的价值不在于给出绝对标准,而在于让评测者知道每一种能力应该观察什么、不应该被什么误导。
7.2 验货顺序和三条硬经验
实际操作时,顺序比指标更重要。我的推荐顺序是:
- 用最小样本跑一遍全部维度,先确认输入输出能跑通,日志和结果目录正常。
- 在单一维度上把任务数量加满,跑出该维度的分数分布,不要直接用平均值。
- 前三维跑完后再做交叉测试:把记忆和推理混在一起,把感知和推理混在一起,看是否存在能力互相依赖。
- 动机和元认知放到最后,因为这两项任务通常没有公开基准,需要人工标注或规则判断,不适合一上来就全自动跑。
三条硬经验:
第一,不要一上来就开最大并发或多卡并行。世界模型评测任务往往要吃大量显存,先估算一下模型需要的显存和内存,再决定 batch size。很多视频预测任务在单机跑不动,不代表模型不行,可能是资源不够。
第二,一定要保存失败案例。只报平均分没有任何诊断价值。评测报告里至少要留 10 个典型失败样本,包括输入、预期输出、实际输出和失败切片。
第三,区分“能力缺失”和“评测缺失”。如果模型没有动机维度,可能是模型本身没有这个能力;如果评测者设计不出合适的任务,也会显得模型全败。这两个原因要分开说,否则会冤枉模型。
8. 别急着用榜单下结论:能力分数和真实理解之间还有很大距离
8.1 前三维“及格”为什么只是阶段性的
感知、记忆、推理能及格,本质原因是这三类能力都可以被外部任务量化,并且任务约束越强,模型越容易表现为合格。这不代表模型已经真正理解世界。一个视频预测模型能生成物理上合理的下一帧,不代表它知道重力、惯性、遮挡这些概念是为什么成立的。正确率可以高,但模型内部可能仍然停在表征层面的匹配。
我在评测中更愿意给前三维打“阶段性及格”:在受控任务里,这些能力确实可用;但在开放环境里,稳定性和泛化性仍然是巨大问题。如果把世界模型用在自动驾驶或机器人上,前三维只是基础素质,离真正落地还有大量边界要处理。
8.2 后两维“全败”反而给评测者留出了真正有价值的机会
动机和元认知几乎全军覆没,这不是坏消息。它意味着当前评测方法学存在巨大空白,也意味着真正能做出可计算、可复现的动机和元认知评测任务的人,会给这个领域带来非常大的价值。
我很期待看到两个方向:一是用行为序列和动态建模方式,把动机变成可观测变量,而不是停留在哲学讨论;二是把信心校准做成标准评测组件,让每个世界模型公开发布时都附上校准曲线,而不是只放几个高光 demo。这比争论“世界模型是不是炒作”更有建设性。
8.3 如果你也要评测世界模型,最后留给你一份自查清单
如果你接下来要自己动手,不用急着造新指标,先过一次这份清单:
- 你定义的“世界模型”是哪一类,输入输出形态是什么?
- 你评测的是模型能力,还是评测任务本身的可完成度?
- 分数是平均值还是有分布、有失败案例?
- 你有没有加入分布外输入和物理一致性检查?
- 你把工作记忆、长期记忆、场景一致性分开测了吗?
- 推理任务给的前提是完整还是缺失?
- 你试图证明的“动机”是代理指标,还是模型内部真实动机?
- 模型说“我有把握”时,它真的有把握吗?
把这份清单完整过一遍之后,再对外说“世界模型行或不行”,会稳很多。评测本身也是一项值得被评测的工作,它比单点刷分更能反映一个模型的真实边界。