ScanNet、ScanNet++与ARKitScenes:VSI-Bench背后的三大3D场景数据源深度解析
ScanNet、ScanNet++与ARKitScenes:VSI-Bench背后的三大3D场景数据源深度解析
【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space
想知道多模态大模型(MLLM)到底有没有"空间感"?VSI-Bench 给出了答案。这个由 NYU 团队推出的视觉空间智能评测基准,用 288 段第一人称室内视频、5000+ 个问答对,系统性检验模型"看懂房间"的能力。而支撑这一切的,正是三大公开 3D 场景数据集——ScanNet、ScanNet++ 和 ARKitScenes。本文带你一文看懂这三大数据源各自的特点、区别,以及它们在 VSI-Bench 评测中的分工。
为什么 3D 场景数据集是 VSI-Bench 的基石?
VSI-Bench 的核心思想很简单:让模型"看"一段在真实房间中拍摄的视频,然后回答关于空间布局、物体位置、距离大小的问题。这意味着它需要一个足够真实的室内场景数据源,而 ScanNet、ScanNet++、ARKitScenes 正是目前学术界最主流的三个室内 3D 重建数据集。
三大数据集各有侧重:有的以规模著称,有的以精度见长,还有的贴近真实消费级设备。把它们组合起来,VSI-Bench 就同时获得了场景多样性、数据质量和实用性三方面的保障。
ScanNet:室内3D重建的经典之作
ScanNet 发布于 2017 年,可以说是室内 3D 场景理解领域的"老大哥"。它用 iPad 搭配深度传感器,扫描了超过 1500 个真实室内场景,覆盖办公室、卧室、客厅、卫生间等常见空间。
它的核心优势在于配套标注极其丰富:每个场景都有完整的 3D 重建网格、语义分割标签(椅子、桌子、窗户……)、相机位姿和实例级标注。正因为如此,大量 3D 视觉和 SLAM 研究都以 ScanNet 为测试场。
在 VSI-Bench 中,ScanNet 贡献了88 个评测场景,其元数据文件 scannet_meta_info_val.json 中记录了每个场景的房间尺寸、物体类别统计(共 33 类)和物体三维包围盒等信息。
ScanNet++:更高精度、更真实纹理
如果说 ScanNet 是"够用",那 ScanNet++ 就是"极致"。作为 2023 年发布的升级版,ScanNet++ 用 iPhone 13 Pro 的激光雷达配合专业相机采集,重建精度和纹理真实度都大幅提升。
它的亮点在于多视角真彩色纹理和更复杂的场景内容:从元数据来看,ScanNet++ 的 50 个评测场景平均房间尺寸达到 25.9 平方米(最大超 128 平方米),对象类别多达 43 类,远超前两者,包含白板、显示器、电源插排、咖啡壶等更细粒度的物品。
这些细节让模型面对的视觉信号更接近真实生活,也让 scannetpp_meta_info_val.json 成为研究复杂空间理解的理想材料。
ARKitScenes:来自苹果的消费级数据集
ARKitScenes 由 Apple 发布,最大特点是全部使用消费级 iPad Pro 的 LiDAR 传感器采集,覆盖了 504 个家庭、超过 1661 个房间,是三者中规模最大的卧室类数据集。
它的房间尺寸波动非常大(从 5.4 到 73 平方米),而且包含冰箱、炉灶、浴缸、洗碗机等大量厨房卫浴设施——这与 ScanNet 系列偏办公室/公共空间的风格形成了很好的互补。VSI-Bench 中 ARKitScenes 提供了150 个评测场景,是三大数据源中贡献最多的,其详细元数据见 arkitscenes_meta_info_val.json。
三大数据源如何支撑 VSI-Bench 的 8 大任务?
VSI-Bench 将空间智能拆解为 8 个具体任务,分为三类:
- 构型类(Configurational):物体相对方向(易/中/难三档)、物体相对距离、物体出现顺序
- 测量估计类(Measurement):物体绝对距离、物体计数、物体尺寸估计、房间尺寸估计
- 时空类(Spatiotemporal):路线规划
其中选择题任务用准确率(Accuracy)评估,数值类任务则采用项目提出的平均相对准确率(MRA)指标。整个任务定义、评测提示词和指标计算逻辑都封装在 vsibench.yaml 与 utils.py 中,方便复现。
如何用这些数据跑一次 VSI-Bench 评测?
想亲手体验也很简单。仓库提供了开箱即用的评测脚本,一条命令即可启动:
bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench评测会调用视频加载与问答生成逻辑,对每个场景的视频提问,最后自动汇总各类任务的得分。三大数据源的元数据均已开源在data/meta_info目录下,你可以直接用load_dataset("nyu-visionx/VSI-Bench")拉取基准数据,复现论文中的全部结果。
总结:三种数据源,一套空间智能试金石
简单来说:ScanNet 提供了经典基准,ScanNet++ 提供了高精度升级,ARKitScenes 提供了消费级规模。三者各司其职,共同构成了 VSI-Bench 评测多模态大模型空间智能的坚实基础。如果你正在研究 3D 场景理解或视频问答,这套组合值得深入研究。
【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考