ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

空间智能篇:三条技术路线如何落到五层能力

2026/8/27 9:56:21 拓冰建站 浏览量
空间智能篇:三条技术路线如何落到五层能力 语料口径概念定义分别取自认知科学分类、视觉空间评测和产业宏观论述。技术路线与例子来自 CVPR 2026、arXiv 与官方项目资料。结论空间智能不是一种模型而是一组可分层验证的能力空间智能指系统能感知、表征和变换空间结构并据此推理或行动。2026 年的工作主要沿三条路线推进多模态大语言模型把图像接到文字和开放式指令主要覆盖感知与推理几何视觉模型把多视图图像接到深度、位姿与点云主要覆盖表征生成式世界模型生成可交互环境主要覆盖生成并与行动相接。三条路线不是同一排行榜上的三个模型类别。它们接受的输入、输出的对象和评测指标不同。当前少数工作开始组合语义与几何但完整覆盖“感知—表征—推理—行动—生成”的系统仍少。一、三个定义回答不同层次的问题认知科学空间任务落在四个格子Newcombe 与 Shipley 2015 年发表的 2×2 分类用两个正交维度划分空间能力。[1]静态动态物体内物体自身形状与部件关系识别形状、部件结构心理旋转、折叠想象物体间物体之间及其与参照系的关系相对位置、地图理解视角采择、导航这张表描述任务所需的认知操作不规定必须使用哪种神经网络。它也解释了为何“识别物体”与“换视角后仍能判断关系”不能合并为同一项分数。AI 的操作性定义把概念改成可出题的任务VSI-Bench 把视觉空间智能定义为感知空间、记住布局并按需检索空间信息回答问题。[2] 它设置 3 类 8 项任务构型类物体计数、相对位置测量类距离、物体尺寸、房间面积时空类物体出现顺序等视频记忆问题。这是“看—记—答”的窄定义适合比较模型在固定题型上的表现但不覆盖真实行动和环境生成。宏观定义把行动与生成纳入范围李飞飞 2025 年的文章把空间智能表述为连接想象、感知与行动的能力并把世界模型作为实现载体。[3] 其三项要求是生成、多模态与交互。按这个范围回答空间关系题只覆盖一部分能力。机器人行动和生成物理一致环境同样属于评价对象。本篇采用的定义本篇把空间智能分成三种操作建立结构从观测中得到物体、形状、位置和尺度变换结构执行心理旋转、视角变换、运动预测或坐标变换使用结构回答关系与度量问题规划路径产生动作或生成新状态。这个工作定义是对三类来源的综合不是新的文献定义。本文负责说明这些定义如何对应 2026 年的技术路线。二、先区分符号接地与空间接地“接地”grounding指把模型的词或判断对应到真实对象。符号接地把画面与词对应。例如从卫星图判断“这是农田”。空间接地把画面与几何量对应。例如给出农田面积、边长和相对河流的距离。多模态大语言模型较擅长开放词汇与语言解释但度量结果不稳定。几何视觉模型直接输出深度和位姿却通常没有语言指令接口。这一区分取自From Perception to Action的综述框架。[4]多张照片、视频或语言描述多模态大语言模型图像 ↔ 词与回答几何视觉模型图像 ↔ 深度、位姿、点云生成式世界模型提示与控制 → 动态环境感知、关系推理、语言解释度量与三维表征生成与交互少数融合系统三、路线甲多模态大语言模型提供语言接口度量仍是弱项解决什么问题。让模型接受图像、视频与自然语言指令在开放类别上识别对象、解释关系并完成空间问答。具体做法。典型系统用视觉编码器把图像变成视觉 token再由语言模型生成答案或推理链。有些工作加入几何专家、像素掩码、可验证奖励或更细的空间训练数据以减少仅凭语言先验回答。效果与证据。原 09 记录了两类证据SpatialScore 用约 5,000 个经人工核验的样本评测 49 个模型覆盖 30 项任务。[5] 原 09 精读记录中的最强模型得分为 60人类为 86.6。OpenBench 把难度分成关系、度量和运动学推理三层。[6] 论文报告室内基准上的优势未稳定迁移到开放世界涉及运动的度量题更困难。这两项结果分别说明综合差距和迁移问题不能据此声称所有多模态模型在所有空间任务上相同。技术身份说明。SpatialScore 和 OpenBench 是评测基准不是训练方法本篇只用它们定位能力缺口。四、路线乙几何视觉模型直接恢复可量算的三维结构VGGT 解决了什么问题VGGTVisual Geometry Grounded Transformer接收同一场景的一张或多张照片。一次前向推理可输出相机参数、深度、点图和三维点轨迹。[7]它对照的传统流程叫 SfM/MVS。SfMStructure from Motion从运动恢复结构先检测与匹配跨图特征点再三角化三维点并做光束法平差。MVSMulti-View Stereo多视图立体再恢复稠密结构。COLMAP 是代表软件。[8] 这类流水线通常要对每个新场景单独迭代优化。VGGT 用 Transformer 的帧内注意力与跨图全局注意力建立对应关系把“每场景优化”变成一次模型前向推理。它由此支持零样本迁移到新场景但输出仍是静态几何不包含语言推理或状态演化。技术身份项目已核实信息模型类型纯视觉、多视图几何 Transformer输入模态同一场景、不同视角的多张普通透视图像输出相机位姿、深度图、稠密三维点云训练与基座端到端训练的纯视觉 Transformer完整训练数据与参数设置见论文本文不从摘要补推冻结策略工具推理不要求为每个场景运行传统 SfM/MVS 优化后处理和下游系统可另接工具作者机构与开放状态Jianyuan Wang 等Meta FAIR 与牛津大学 Visual Geometry Group代码和模型公开2026 年生态补了四类边界FlashVGGT 扩展图像数量把每帧压成少量描述子 token再做交叉注意力。[9] 1,000 张图的推理时间为原版的 9.3%3,500 张图用时 146 秒580 张图占 10.85 GB 显存。DVGT 补米制度量尺度直接在自车坐标系输出米级点图和位姿适配任意数量与参数的车载相机。[10] 它仍未自动得到经纬度。VGGT-360 处理全景图免训练地把 360° 全景自适应切成透视图交给原版重建再投影为全景深度。[11]Emergent Extreme-View Geometry 检验无重叠视图冻结解码头只微调骨干约 8 万个 bias 参数。[12] 用 6.5 万图像对训练 2 轮后野外数据中位旋转误差从 42.4° 降到 13.1°。论文还报告近一半无重叠图像对的旋转误差低于 30°。这些工作都加强几何表征但不等于加入语言接口、地理参照或动态预测。五、路线丙生成式世界模型把空间结构变成可交互环境Genie 3、Cosmos 与 Marble 都直接生成或提供生成环境的能力但产品形态不同Genie 3 从文字提示生成 720p、24 帧/秒、可实时导航的动态环境并在数分钟内保持一致官方页面未提供可下载代码或权重。[13]Cosmos 是面向物理 AI 的平台包含数据处理、世界基础模型、后训练示例和视频分词器并开放代码与部分权重。[14]Marble 把文字、照片、视频、三维布局或全景图转成可编辑、可下载的三维环境可导出.spz或.ply。[15] 它是商业产品不等于开放研究模型。三者共同输出环境或环境生成基础设施而不是判别式空间问答。它们在空间智能中主要落在生成层。三条世界模型路径的图片证据见《01 世界模型篇》。六、五层能力把三条路线放到同一框架下面的五层是原 09 的综合框架依据是李飞飞提出的生成、多模态、交互要求与语料分布不是某篇论文的原始分类。能力层回答的问题典型任务主要路线常用证据感知观测里有什么检测、分割、分类多模态大语言模型、视觉模型分类、检测与分割指标表征空间结构怎样编码深度、位姿、点云、空间嵌入几何视觉模型几何误差、重建质量推理结构之间有什么关系方位、距离、路径、计数、比较多模态大语言模型题目正确率、度量误差行动应执行什么动作导航、操作、工具调用动作条件世界模型、智能体任务成功率、回报、工具执行结果生成新状态长什么样场景生成、未来帧预测生成式世界模型连续一致性、可控性、未来预测五层是分析维度不是单向流水线。生成系统也要感知提示和历史行动系统也会调用表征与推理表格只标每条路线的主要产出。五层与认知科学 2×2 的关系两套框架不能一一对应2×2 按“物体内/物体间”和“静态/动态”分任务五层按系统处理环节分能力。它们可以交叉使用。例如静态物体间关系可以在感知、表征或推理层评测动态物体间导航可以同时涉及表征、推理和行动生成层可以同时生成物体内形变与物体间运动。因此声称一项工作“覆盖空间智能”时至少应同时报它在 2×2 哪些任务格以及在五层中的主要输出。七、少数融合工作G²VLM 连接语言与几何G²VLM 是原语料中连接路线甲与路线乙的少数尝试。[16] 它统一训练三维重建与空间推理并以几何特征增强视觉语言推理。一个 2B 参数版本在特定空间基准上比 GPT-4o 高 18.5 分该差值只适用于论文所列设置。八、四个常见误判会识别不等于会度量。说出“农田”证明符号接地面积、距离和朝向要用空间接地证据。有三维不等于会预测。静态点云属于表征动作条件下的下一状态才达到世界模型门槛。会回答不等于会行动。问答正确率与机器人或工具执行成功率是不同证据。系统高分不等于基础模型内生能力高。外部检索、感知模块和 GIS 工具可能贡献主要增益必须单独报告。小结空间智能可以从认知任务、技术路线和能力层三个视角描述。多模态大语言模型主要提供符号接地与推理接口几何视觉模型提供三维表征生成式世界模型提供环境生成和交互。概念总关系见《00 概览篇》世界模型路线见《01 世界模型篇》。下一篇《03 地理空间智能篇》加入地球参照、尺度、多源数据和确定性工具。参考文献[1] Newcombe, N. S.; Shipley, T. F.Thinking About Spatial Thinking: New Typology, New Assessments. 2015. https://doi.org/10.1007/978-94-017-9297-4_10。[2] Yang, J. et al.Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces. 2025. https://arxiv.org/abs/2412.14171代码https://github.com/vision-x-nyu/thinking-in-space。[3] Li, F.-F.From Words to Worlds: Spatial Intelligence is AI’s Next Frontier. 2025. https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence。[4] Felicia, G. et al.From Perception to Action: Spatial AI Agents and World Models. 2026. https://arxiv.org/abs/2602.01644。[5] Wu, H. et al.SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence. 2026 修订版. https://arxiv.org/abs/2505.17012。[6] Wu, M. et al.From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs. 2025. https://arxiv.org/abs/2512.19683。[7] Wang, J. et al.VGGT: Visual Geometry Grounded Transformer. 2025. https://arxiv.org/abs/2503.11651代码https://github.com/facebookresearch/vggt。[8] Schönberger, J. L.; Frahm, J.-M.Structure-from-Motion Revisited. 2016. https://openaccess.thecvf.com/content_cvpr_2016/html/Schonberger_Structure-From-Motion_Revisited_CVPR_2016_paper.html项目https://colmap.github.io/。[9] Wang, Z.; Xu, D.FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention. 2026. https://arxiv.org/abs/2512.01540。[10] Zuo, S. et al.DVGT: Driving Visual Geometry Transformer. 2026. https://arxiv.org/abs/2512.16919。[11] Yuan, J. et al.VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation. 2026. https://arxiv.org/abs/2603.18943。[12] Zhang, Y. et al.Emergent Extreme-View Geometry in 3D Foundation Models. 2025. https://arxiv.org/abs/2511.22686。[13] Google DeepMind.Genie 3: A new frontier for world models. 2025. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/。[14] Agarwal, N. et al.Cosmos World Foundation Model Platform for Physical AI. 2025. https://arxiv.org/abs/2501.03575代码https://github.com/NVIDIA/Cosmos。[15] World Labs.Marble: A Multimodal World Model. 2025. https://www.worldlabs.ai/blog/marble-world-model。[16] Hu, W. et al.G²VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning. 2026. https://openaccess.thecvf.com/content/CVPR2026/html/Hu_G2VLM_Geometry_Grounded_Vision_Language_Model_with_Unified_3D_Reconstruction_CVPR_2026_paper.html。