资讯动态

多模态大模型能“看懂“空间吗?VSI-Bench:一场5000+问答的视觉空间智能大考

发布时间:2026/8/16 20:39:38 来源:尧图企业网站定制
多模态大模型能看懂空间吗VSI-Bench一场5000问答的视觉空间智能大考【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space多模态大模型能看懂空间吗这是 VSI-Bench 视觉空间智能评测基准想要回答的核心问题。由纽约大学、耶鲁大学与斯坦福大学联合打造、入选 CVPR 2025 Oral 的 thinking-in-space 项目用 5000 视频问答和 288 段真实室内第一视角视频对 GPT-4o、Gemini-1.5 等 15 个主流多模态大模型进行了一场空间智商大考。结果令人意外即便是最顶尖的模型平均得分也只有人类水平的六成左右。多模态大模型空间理解能力究竟如何视觉空间智能评测怎么做本文一次讲清 VSI-Bench 的任务设计、评测结果与运行方法。什么是视觉空间智能多模态大模型为何需要这场空间大考人类走进一个陌生房间扫一眼就能记住家具布局、估算物体距离、规划行走路线——这种看一眼视频就能在脑中构建空间认知地图并回答空间问题的能力就是视觉空间智能Visual-Spatial Intelligence。它能帮机器人导航、帮 AR 设备理解环境也是衡量多模态大模型是否真正理解三维世界的关键维度。现有的大模型评测大多停留在看图说话视频问答层面几乎没有人系统性地考过模型的空间理解能力。VSI-Bench 正是为此而生让模型观看一段室内环境的视频再回答关于空间布局、距离、方向、路线的各种问题考察它能否像人一样看到空间、记住空间、回忆空间。VSI-Bench 是什么5000 问答背后的评测设计VSI-Bench 是一个专为多模态大模型设计的视觉空间智能评测基准包含5000 条问答对全部来自288 段第一视角egocentric室内视频。这些视频取自三大公开室内三维重建数据集的验证集ScanNet、ScanNet 与 ARKitScenes场景覆盖客厅、厨房、办公室、实验室等多种真实环境。为了保证质量每道题目都经过了多轮人工迭代精修并以真实的三维扫描数据如物体包围盒、房间尺寸作为标准答案确保标准答案本身是客观准确的。项目的三维场景元信息也已开源在data/meta_info目录下包含场景房间尺寸、物体计数、物体包围盒坐标等例如arkitscenes_meta_info_val.json、scannet_meta_info_val.json、scannetpp_meta_info_val.json配合other_scripts/image_poses/下的位姿提取脚本可以复现整个数据构建流程。VSI-Bench 的 8 大空间任务视觉空间智能都在考什么VSI-Bench 将评测划分为8 种任务、3 大类型从易到难层层递进构型类任务Configurational占 47.6%物体计数、物体相对方向、物体相对距离、物体出现顺序——考察模型能否理解什么物体在哪儿。测量类任务Measurement占 40.3%物体绝对距离、物体尺寸估计、房间尺寸估计——考察模型能否目测出真实数值。时空类任务SpatioTemporal占 12.1%路线规划——考察模型能否把空间记忆转化为行走指令。具体来说这 8 种任务各显神通物体计数问房间里有多少把椅子相对方向问站在冰箱前面对沙发水壶在左边、右边还是后面绝对距离问床和沙发的距离是多少米甚至还有你是一个从马桶出发的机器人如何走到洗衣机这样的路线规划题堪称一场全方位的空间推理考试。值得一提的是8 种任务中有 4 种绝对距离、计数、尺寸、房间大小要求模型直接输出数值答案评测难度明显高于普通的四选一选择题更能暴露模型空间感知的真实短板。多模态大模型空间成绩单15 个模型的评测结果研究团队以零样本zero-shot方式评测了 15 个支持视频输入的多模态大模型涵盖闭源模型 GPT-4o、Gemini-1.5 系列以及开源模型 InternVL2、VILA、LongVILA、LongVA、LLaVA-OneVision、LLaVA-NeXT-Video 等家族。评价指标上选择题任务使用准确率Accuracy数值题任务则采用团队提出的平均相对准确率MRAMean Relative Accuracy允许一定的数值误差并分级打分评价方式更贴合真实的空间估计场景。结果相当扎心人类水平平均得分高达 79.2而表现最好的 Gemini-1.5 Pro 也只有约 45.4GPT-4o 约 34.0开源模型中的 LLaVA-NeXT-Video-72B 约 40.9。也就是说即便是世界顶级的视觉大模型空间智能也远未达到人类水平尤其在绝对距离、尺寸估计这类需要数值感知的任务上表现普遍偏弱。这也说明视觉空间智能评测仍有巨大的提升空间是下一代多模态模型必须攻克的关卡。手把手运行 VSI-Bench 评测安装与一键评测想亲手复现这场空间大考项目基于 lmms-eval 评测框架搭建评测逻辑集中在lmms_eval/tasks/vsibench/vsibench.yaml任务配置与lmms_eval/tasks/vsibench/utils.py提示词构造、指标计算并提供了开箱即用的评测脚本evaluate_all_in_one.sh。第一步安装环境conda create --name vsibench python3.10 conda activate vsibench git clone https://gitcode.com/gh_mirrors/th/thinking-in-space cd thinking-in-space git submodule update --init --recursive cd transformers pip install -e . cd .. pip install -e . pip install deepspeed第二步一键评测bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench脚本会自动检测 GPU 数量、逐个跑完所有内置模型也可以指定单个模型如--model gemini_1p5_pro_002并把日志保存到按日期命名的输出目录。评测数据则托管在 HuggingFace 的nyu-visionx/VSI-Bench数据集上也可用datasets库直接加载from datasets import load_dataset vsi_bench load_dataset(nyu-visionx/VSI-Bench)整个过程零样本、固定提示词、贪心解码保证结果可复现非常适合拿来对比不同模型的视觉空间智能水平。结语空间智能大模型的下一个必考点VSI-Bench 用一场 5000 问答的视觉空间智能大考第一次系统性地丈量了多模态大模型的空间理解能力它们能看见画面却远未看懂空间。对于研究者VSI-Bench 提供了可复现的评测基准与开源元数据对于普通开发者它也是了解多模态大模型能力边界、选型对比的实用工具。下一次再有人问大模型能看懂空间吗不妨用 VSI-Bench 的成绩单来回答 【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价