资讯动态

一条命令跑通VSI-Bench:evaluate_all_in_one.sh实战教程(16款模型一键评测)

发布时间:2026/8/16 18:43:14 来源:尧图企业网站定制
一条命令跑通VSI-Benchevaluate_all_in_one.sh实战教程16款模型一键评测【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-spaceVSI-Bench是CVPR 2025 Oral论文《Thinking in Space》推出的多模态大模型空间智能评测基准专门检验模型能否从第一视角视频中看懂、记住并回忆三维空间。本教程将带你用一条命令跑通VSI-Bench评测官方一键脚本evaluate_all_in_one.sh内置16款主流模型的完整配置从GPT-4o、Gemini等闭源API模型到LLaVA-OneVision、InternVL2、LongVA等开源模型全覆盖无需手写任何评测参数克隆仓库、装好环境、敲一行命令即可开跑。什么是VSI-Bench多模态大模型的空间智能考卷传统视频问答评测只考看到了什么而VSI-Bench更进一步考的是空间智能看完一段室内第一视角视频后模型能否像人类一样在大脑中构建认知地图能否回答沙发和电视距离多远从厕所到厨房怎么走房间里有几张椅子这类问题VSI-Bench的数据规模与覆盖面相当扎实5000 问答对来自288 段第一视角视频视频取自ScanNet、ScanNet、ARKitScenes三大公开室内3D重建数据集的验证集共8 类任务归为三大类型构型任务Configuration、测量估计Measurement、时空任务SpatioTemporal。evaluate_all_in_one.sh16款模型一键评测的秘密很多评测框架的痛点在于每个模型要单独写模型参数、提示词模板和batch配置光调试就耗掉大半天。而evaluate_all_in_one.sh把这些全部封装好了——脚本内部为每款模型预置了完整的model_family和model_args映射你只需告诉它评测哪个模型剩下的交给脚本。脚本共内置16 款模型覆盖 8 个模型家族模型别名模型家族规格类型gemini_1p5_flash/gemini_1p5_pro_002/gemini_2p0_flash_expGemini API1.5 Flash / 1.5 Pro / 2.0 Flash闭源APIgpt_4o_2024_08_06_f16GPT-4o4o16帧闭源APIllava_one_vision_qwen2_0p5b_ov_32f/_7b_/_72b_LLaVA-OneVision0.5B / 7B / 72B开源llava_next_video_7b_qwen2_32f/_72b_LLaVA-NeXT-Video7B / 72B开源llama3_vila1p5_8b_32f/_40b_VILA8B / 40B开源llama3_longvila_8b_128frames_32fLongVILA8B128帧长视频开源longva_7b_32fLongVA7B开源internvl2_2b_8f/_8b_/_40b_InternVL22B / 8B / 40B开源参数--model all时默认跑其中 8 款开源模型无需API Key即可本地评测其余模型按需指定。VSI-Bench安装步骤三步搭好评测环境第一步克隆仓库并初始化子模块仓库包含transformers子模块评测依赖的定制版本务必初始化git clone https://gitcode.com/gh_mirrors/th/thinking-in-space cd thinking-in-space git submodule update --init --recursive第二步创建Python环境并安装依赖conda create --name vsibench python3.10 conda activate vsibench cd transformers pip install -e . cd .. pip install -e . pip install deepspeed第三步准备API Key仅评测闭源模型时需要评测 Gemini 和 GPT-4o 前在脚本开头填入密钥见evaluate_all_in_one.sh第12-13行export OPENAI_API_KEY你的OpenAI密钥 export GOOGLE_API_KEY你的Gemini密钥一条命令开始VSI-Bench模型评测环境就绪后评测就是这么简单bash evaluate_all_in_one.sh --model all --num_processes 8 --benchmark vsibench--model all一键跑完默认 8 款开源模型--num_processes 8并行进程数按你的 GPU 显存调整--benchmark vsibench评测任务名当前默认值可省略。想先小范围验证流程是否通畅加上--limit参数只评测前 20 条样本几分钟即可看到结果bash evaluate_all_in_one.sh --model llava_one_vision_qwen2_0p5b_ov_32f --limit 20想对比多款指定模型模型名用逗号分隔即可bash evaluate_all_in_one.sh --model gemini_1p5_pro_002,gpt_4o_2024_08_06_f16常用参数详解定制你的VSI-Bench评测evaluate_all_in_one.sh还支持几个实用参数方便你灵活定制评测--num_processes加速并行进程数默认 4显存充足可调大72B/40B 大模型脚本会自动降为 1--num_frames视频采样帧数默认 32 帧InternVL2 系列固定 8 帧--output_path结果输出目录默认logs/日期按美东时间命名--limit限制评测样本数适合快速调试。模型与任务的绑定关系、提示词模板等逻辑分别定义在评测配置 vsibench.yaml 和评测逻辑 utils.py 中各模型家族的接入实现可参考 gemini_api.py、gpt4v.py、vila.py、longva.py、internvl2.py 等文件。看懂评测结果准确率与MRA两大指标VSI-Bench 的 8 类任务采用两套评测指标跑完会自动输出综合得分MCA 选择题任务相对方向、相对距离、路线规划、出现顺序用准确率Accuracy评估要求模型直接输出选项字母NA 数值题任务绝对距离、物体计数、物体大小、房间大小用官方提出的MRAMean Relative Accuracy平均相对准确率评估衡量模型预测值与真实值的相对误差。最终结果以overall综合分呈现并按 8 类任务逐项打分方便你横向对比各模型的空间智能水平。常见问题与避坑指南Q1--model all会评测闭源API模型吗不会。all默认只跑 8 款开源模型闭源模型需在脚本中填好 API Key 后显式指定名称。Q2评测到一半显存爆了怎么办调小--num_processes或改用更小规格的模型如internvl2_2b_8f、llava_one_vision_qwen2_0p5b_ov_32f。Q3结果输出到哪里默认在logs/当天日期/vsibench/目录下按模型名分别保存日志与样本结果方便对比复现。Q4开源模型结果和论文表格有差异官方说明指出由于数据后期精修开源模型复现结果可能与论文表格略有出入属正常现象建议以自己跑出的结果为准。总结VSI-Bench 为多模态大模型的空间智能提供了可量化的评测标准而 evaluate_all_in_one.sh 则把评测门槛降到了一条命令。无论你是想复现论文结果、横向对比主流模型还是验证自己微调的视频模型克隆仓库后按本教程三步操作即可快速上手 VSI-Bench 一键评测。现在就动手看看你手上的模型到底懂不懂空间吧【免费下载链接】thinking-in-spaceOfficial repo and evaluation implementation of VSI-Bench项目地址: https://gitcode.com/gh_mirrors/th/thinking-in-space创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价