语料口径:概念定义分别取自认知科学分类、视觉空间评测和产业宏观论述。技术路线与例子来自 CVPR 2026、arXiv 与官方项目资料。
结论:空间智能不是一种模型,而是一组可分层验证的能力
空间智能指系统能感知、表征和变换空间结构,并据此推理或行动。2026 年的工作主要沿三条路线推进:
- 多模态大语言模型把图像接到文字和开放式指令,主要覆盖感知与推理;
- 几何视觉模型把多视图图像接到深度、位姿与点云,主要覆盖表征;
- 生成式世界模型生成可交互环境,主要覆盖生成,并与行动相接。
三条路线不是同一排行榜上的三个模型类别。它们接受的输入、输出的对象和评测指标不同。当前少数工作开始组合语义与几何,但完整覆盖“感知—表征—推理—行动—生成”的系统仍少。
一、三个定义回答不同层次的问题
认知科学:空间任务落在四个格子
Newcombe 与 Shipley 2015 年发表的 2×2 分类用两个正交维度划分空间能力。[1]
| 静态 | 动态 | |
|---|---|---|
| 物体内:物体自身形状与部件关系 | 识别形状、部件结构 | 心理旋转、折叠想象 |
| 物体间:物体之间及其与参照系的关系 | 相对位置、地图理解 | 视角采择、导航 |
这张表描述任务所需的认知操作,不规定必须使用哪种神经网络。它也解释了为何“识别物体”与“换视角后仍能判断关系”不能合并为同一项分数。
AI 的操作性定义:把概念改成可出题的任务
VSI-Bench 把视觉空间智能定义为:感知空间、记住布局,并按需检索空间信息回答问题。[2] 它设置 3 类 8 项任务:
- 构型类:物体计数、相对位置;
- 测量类:距离、物体尺寸、房间面积;
- 时空类:物体出现顺序等视频记忆问题。
这是“看—记—答”的窄定义,适合比较模型在固定题型上的表现,但不覆盖真实行动和环境生成。
宏观定义:把行动与生成纳入范围
李飞飞 2025 年的文章把空间智能表述为连接想象、感知与行动的能力,并把世界模型作为实现载体。[3] 其三项要求是生成、多模态与交互。按这个范围,回答空间关系题只覆盖一部分能力。机器人行动和生成物理一致环境同样属于评价对象。
本篇采用的定义
本篇把空间智能分成三种操作:
- 建立结构:从观测中得到物体、形状、位置和尺度;
- 变换结构:执行心理旋转、视角变换、运动预测或坐标变换;
- 使用结构:回答关系与度量问题,规划路径,产生动作或生成新状态。
这个工作定义是对三类来源的综合,不是新的文献定义。本文负责说明这些定义如何对应 2026 年的技术路线。
二、先区分符号接地与空间接地
“接地”(grounding)指把模型的词或判断对应到真实对象。
- 符号接地把画面与词对应。例如从卫星图判断“这是农田”。
- 空间接地把画面与几何量对应。例如给出农田面积、边长和相对河流的距离。
多模态大语言模型较擅长开放词汇与语言解释,但度量结果不稳定。几何视觉模型直接输出深度和位姿,却通常没有语言指令接口。这一区分取自From Perception to Action的综述框架。[4]
三、路线甲:多模态大语言模型提供语言接口,度量仍是弱项
解决什么问题。让模型接受图像、视频与自然语言指令,在开放类别上识别对象、解释关系并完成空间问答。
具体做法。典型系统用视觉编码器把图像变成视觉 token,再由语言模型生成答案或推理链。有些工作加入几何专家、像素掩码、可验证奖励或更细的空间训练数据,以减少仅凭语言先验回答。
效果与证据。原 09 记录了两类证据:
- SpatialScore 用约 5,000 个经人工核验的样本评测 49 个模型,覆盖 30 项任务。[5] 原 09 精读记录中的最强模型得分为 60,人类为 86.6。
- OpenBench 把难度分成关系、度量和运动学推理三层。[6] 论文报告室内基准上的优势未稳定迁移到开放世界,涉及运动的度量题更困难。
这两项结果分别说明综合差距和迁移问题,不能据此声称所有多模态模型在所有空间任务上相同。
技术身份说明。SpatialScore 和 OpenBench 是评测基准,不是训练方法;本篇只用它们定位能力缺口。
四、路线乙:几何视觉模型直接恢复可量算的三维结构
VGGT 解决了什么问题
VGGT(Visual Geometry Grounded Transformer)接收同一场景的一张或多张照片。一次前向推理可输出相机参数、深度、点图和三维点轨迹。[7]
它对照的传统流程叫 SfM/MVS。SfM(Structure from Motion,从运动恢复结构)先检测与匹配跨图特征点,再三角化三维点并做光束法平差。MVS(Multi-View Stereo,多视图立体)再恢复稠密结构。COLMAP 是代表软件。[8] 这类流水线通常要对每个新场景单独迭代优化。
VGGT 用 Transformer 的帧内注意力与跨图全局注意力建立对应关系,把“每场景优化”变成一次模型前向推理。它由此支持零样本迁移到新场景,但输出仍是静态几何,不包含语言推理或状态演化。
技术身份
| 项目 | 已核实信息 |
|---|---|
| 模型类型 | 纯视觉、多视图几何 Transformer |
| 输入模态 | 同一场景、不同视角的多张普通透视图像 |
| 输出 | 相机位姿、深度图、稠密三维点云 |
| 训练与基座 | 端到端训练的纯视觉 Transformer;完整训练数据与参数设置见论文,本文不从摘要补推冻结策略 |
| 工具 | 推理不要求为每个场景运行传统 SfM/MVS 优化;后处理和下游系统可另接工具 |
| 作者机构与开放状态 | Jianyuan Wang 等;Meta FAIR 与牛津大学 Visual Geometry Group;代码和模型公开 |
2026 年生态补了四类边界
- FlashVGGT 扩展图像数量:把每帧压成少量描述子 token,再做交叉注意力。[9] 1,000 张图的推理时间为原版的 9.3%;3,500 张图用时 146 秒;580 张图占 10.85 GB 显存。
- DVGT 补米制度量尺度:直接在自车坐标系输出米级点图和位姿,适配任意数量与参数的车载相机。[10] 它仍未自动得到经纬度。
- VGGT-360 处理全景图:免训练地把 360° 全景自适应切成透视图,交给原版重建,再投影为全景深度。[11]
- Emergent Extreme-View Geometry 检验无重叠视图:冻结解码头,只微调骨干约 8 万个 bias 参数。[12] 用 6.5 万图像对训练 2 轮后,野外数据中位旋转误差从 42.4° 降到 13.1°。论文还报告近一半无重叠图像对的旋转误差低于 30°。
这些工作都加强几何表征,但不等于加入语言接口、地理参照或动态预测。
五、路线丙:生成式世界模型把空间结构变成可交互环境
Genie 3、Cosmos 与 Marble 都直接生成或提供生成环境的能力,但产品形态不同:
- Genie 3 从文字提示生成 720p、24 帧/秒、可实时导航的动态环境,并在数分钟内保持一致;官方页面未提供可下载代码或权重。[13]
- Cosmos 是面向物理 AI 的平台,包含数据处理、世界基础模型、后训练示例和视频分词器,并开放代码与部分权重。[14]
- Marble 把文字、照片、视频、三维布局或全景图转成可编辑、可下载的三维环境,可导出
.spz或.ply。[15] 它是商业产品,不等于开放研究模型。
三者共同输出环境或环境生成基础设施,而不是判别式空间问答。它们在空间智能中主要落在生成层。三条世界模型路径的图片证据见《01 世界模型篇》。
六、五层能力把三条路线放到同一框架
下面的五层是原 09 的综合框架,依据是李飞飞提出的生成、多模态、交互要求与语料分布,不是某篇论文的原始分类。
| 能力层 | 回答的问题 | 典型任务 | 主要路线 | 常用证据 |
|---|---|---|---|---|
| 感知 | 观测里有什么 | 检测、分割、分类 | 多模态大语言模型、视觉模型 | 分类、检测与分割指标 |
| 表征 | 空间结构怎样编码 | 深度、位姿、点云、空间嵌入 | 几何视觉模型 | 几何误差、重建质量 |
| 推理 | 结构之间有什么关系 | 方位、距离、路径、计数、比较 | 多模态大语言模型 | 题目正确率、度量误差 |
| 行动 | 应执行什么动作 | 导航、操作、工具调用 | 动作条件世界模型、智能体 | 任务成功率、回报、工具执行结果 |
| 生成 | 新状态长什么样 | 场景生成、未来帧预测 | 生成式世界模型 | 连续一致性、可控性、未来预测 |
五层是分析维度,不是单向流水线。生成系统也要感知提示和历史,行动系统也会调用表征与推理;表格只标每条路线的主要产出。
五层与认知科学 2×2 的关系
两套框架不能一一对应:2×2 按“物体内/物体间”和“静态/动态”分任务,五层按系统处理环节分能力。它们可以交叉使用。例如:
- 静态物体间关系可以在感知、表征或推理层评测;
- 动态物体间导航可以同时涉及表征、推理和行动;
- 生成层可以同时生成物体内形变与物体间运动。
因此,声称一项工作“覆盖空间智能”时,至少应同时报它在 2×2 哪些任务格,以及在五层中的主要输出。
七、少数融合工作:G²VLM 连接语言与几何
G²VLM 是原语料中连接路线甲与路线乙的少数尝试。[16] 它统一训练三维重建与空间推理,并以几何特征增强视觉语言推理。一个 2B 参数版本在特定空间基准上比 GPT-4o 高 18.5 分;该差值只适用于论文所列设置。
八、四个常见误判
- 会识别,不等于会度量。说出“农田”证明符号接地;面积、距离和朝向要用空间接地证据。
- 有三维,不等于会预测。静态点云属于表征;动作条件下的下一状态才达到世界模型门槛。
- 会回答,不等于会行动。问答正确率与机器人或工具执行成功率是不同证据。
- 系统高分,不等于基础模型内生能力高。外部检索、感知模块和 GIS 工具可能贡献主要增益,必须单独报告。
小结
空间智能可以从认知任务、技术路线和能力层三个视角描述。多模态大语言模型主要提供符号接地与推理接口,几何视觉模型提供三维表征,生成式世界模型提供环境生成和交互。
概念总关系见《00 概览篇》,世界模型路线见《01 世界模型篇》。下一篇《03 地理空间智能篇》加入地球参照、尺度、多源数据和确定性工具。
参考文献
[1] Newcombe, N. S.; Shipley, T. F.Thinking About Spatial Thinking: New Typology, New Assessments. 2015. https://doi.org/10.1007/978-94-017-9297-4_10。
[2] Yang, J. et al.Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces. 2025. https://arxiv.org/abs/2412.14171;代码:https://github.com/vision-x-nyu/thinking-in-space。
[3] Li, F.-F.From Words to Worlds: Spatial Intelligence is AI’s Next Frontier. 2025. https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence。
[4] Felicia, G. et al.From Perception to Action: Spatial AI Agents and World Models. 2026. https://arxiv.org/abs/2602.01644。
[5] Wu, H. et al.SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence. 2026 修订版. https://arxiv.org/abs/2505.17012。
[6] Wu, M. et al.From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs. 2025. https://arxiv.org/abs/2512.19683。
[7] Wang, J. et al.VGGT: Visual Geometry Grounded Transformer. 2025. https://arxiv.org/abs/2503.11651;代码:https://github.com/facebookresearch/vggt。
[8] Schönberger, J. L.; Frahm, J.-M.Structure-from-Motion Revisited. 2016. https://openaccess.thecvf.com/content_cvpr_2016/html/Schonberger_Structure-From-Motion_Revisited_CVPR_2016_paper.html;项目:https://colmap.github.io/。
[9] Wang, Z.; Xu, D.FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention. 2026. https://arxiv.org/abs/2512.01540。
[10] Zuo, S. et al.DVGT: Driving Visual Geometry Transformer. 2026. https://arxiv.org/abs/2512.16919。
[11] Yuan, J. et al.VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation. 2026. https://arxiv.org/abs/2603.18943。
[12] Zhang, Y. et al.Emergent Extreme-View Geometry in 3D Foundation Models. 2025. https://arxiv.org/abs/2511.22686。
[13] Google DeepMind.Genie 3: A new frontier for world models. 2025. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/。
[14] Agarwal, N. et al.Cosmos World Foundation Model Platform for Physical AI. 2025. https://arxiv.org/abs/2501.03575;代码:https://github.com/NVIDIA/Cosmos。
[15] World Labs.Marble: A Multimodal World Model. 2025. https://www.worldlabs.ai/blog/marble-world-model。
[16] Hu, W. et al.G²VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning. 2026. https://openaccess.thecvf.com/content/CVPR2026/html/Hu_G2VLM_Geometry_Grounded_Vision_Language_Model_with_Unified_3D_Reconstruction_CVPR_2026_paper.html。