零样本立体匹配快速上手FoundationStereo 从环境搭建到 3D 点云输出指南【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo刚买回一套双目相机兴冲冲想给新场景做深度测量传统立体匹配算法却立刻给你泼冷水这个场景它没见过需要重新收集数据、重新微调才能勉强出结果换个环境又得重来一遍。FoundationStereo这款斩获 CVPR 2025 最佳论文提名的零样本立体匹配开源项目正试图终结这种一景一训的窘境——让任何陌生环境都能开箱即用。先搞懂三件事视差、零样本与合成数据 人眼是怎么测距的两只眼睛看向同一个物体它在左右眼画面里的位置会有细微差异这个差异就叫视差disparity。物体越近视差越大越远视差越小。人脑正是靠这种天生的立体匹配感知距离立体相机也遵循同样的逻辑模型算出左右图逐像素的视差便得到一张视差图。零样本到底意味着什么传统深度立体匹配算法在公开数据集上成绩斐然但那属于考过的题遇到没见过的新场景精度就明显下滑通常需要针对该领域做微调。而零样本zero-shot意味着模型在没有接触过你场景的前提下直接推理就能拿到可用结果。这正是 FoundationStereo 的核心价值——它让立体匹配第一次拥有了基础模型式的泛化能力。为什么用合成数据训练要让模型见多识广官方构建了包含 100 万对立体图像的合成训练集FSD 数据集覆盖丰富场景与高真实感渲染并配套一条自动自校准管道把模糊、有歧义的样本自动剔除从源头保证喂给模型的都是好题。再通过 side-tuning 骨干网络借用 DINOv2 等视觉基础模型的单目先验来弥补合成域与真实域的差距配合长程上下文推理做代价体过滤。这套组合拳的成果是在 Middlebury 与 ETH3D 两个国际权威排行榜上双双登顶第一。图注上图依次为左视图、右视图和视差可视化。颜色越暖代表视差越大即物体离相机越近。一次看懂输出视差图、深度图与点云FoundationStereo 的直接输出是视差图。把相机内参和基线左右相机之间的距离代入公式深度 焦距 × 基线 ÷ 视差即可换算成带真实尺度米的深度图进而生成 3D 点云。看懂这条链路你就明白为什么官方 demo 会同时产出视差可视化、depth_meter.npy和cloud.ply三类文件。从零跑通四步上手路线 第一步准备硬件与环境官方已在 Linux 下的 3090、4090、A100、V100 及 Jetson Orin 上验证过推理对显存有一定要求建议优先保证 NVIDIA GPU 可用。环境搭建推荐使用 condagit clone https://gitcode.com/gh_mirrors/fo/FoundationStereo cd FoundationStereo conda env create -f environment.yml conda run -n foundation_stereo pip install flash-attn conda activate foundation_stereo为什么 flash-attn 要单独安装因为它在环境创建阶段容易引发冲突报错单独装一步能有效避开这个官方都重点标注过的坑。第二步获取预训练权重下载基础模型后把整个权重文件夹例如23-51-11放到项目根目录下的./pretrained_models/里。官方提供了两个通用权重23-51-11基于 ViT-Large精度更佳和11-33-40基于 ViT-Small速度更快。新手建议直接用前者质量更有保障。第三步跑通官方 demo回到项目根目录执行python scripts/run_demo.py \ --left_file ./assets/left.png \ --right_file ./assets/right.png \ --ckpt_dir ./pretrained_models/23-51-11/model_best_bp2.pth \ --out_dir ./test_outputs/它会读取仓库自带的左右图输出视差可视化并弹窗展示 Open3D 点云按 ESC 退出。为什么能开箱即用因为示例内参文件 assets/K.txt第一行是 1×9 的内参矩阵第二行是以米为单位的基线已经替你填好模型无需任何额外设置。第四步换成自己的数据并解读结果替换左右图路径再按同样格式准备内参文件即可。关键前提左右图必须是已校正极线对齐、无鱼眼畸变的立体像对大多数商用双目相机如 ZED、RealSense出厂已处理妥当直接导出就能用。图注Open3D 渲染的彩色点云每个点都带原始 RGB 颜色场景三维结构一目了然。遇到问题怎么办高频坑位排雷 ⚠️不输出或输出残缺点云先确认内参文件格式正确再调点云相关参数如--z_far裁剪最大深度、--remove_invisible剔除左右图不重叠的不可靠点、--denoise_cloud离群点去噪。报CUDNN_STATUS_NOT_SUPPORTED错误多半是显存不足OOM的信号把分辨率降下来如--scale 0.5或换更大显存的显卡即可。图像超过 1000px 时卡顿两种解法——加--hiera 1开启分层推理拿到全分辨率深度较慢或调小--scale换取速度。GPU 不支持 flash-attn老显卡的常见困扰官方 FAQ 与相关 issue 中已有替代方案可直接检索关键词定位。左右图传反左图必须来自左侧相机画面中物体应更靠右传反会得到完全错误的视差。它能用在哪儿与下一步建议 零样本立体深度估计的想象空间很大自动驾驶与机器人导航中车辆和机械臂面对陌生环境也能实时感知三维结构增强现实里虚拟物体可以被更自然地锚定到真实场景遥感测绘中无人机航拍影像同样能借它提取地形信息。若对推理速度有极致追求还可参考 README 中的 TensorRT 方案官方在同一张 3090 上实测获得约 6 倍加速。下一步建议从三件事入手先完整跑通 demo 感受流程再用自己的双目相机数据复现一次最后阅读core/目录下的源码理解视差是如何一步步变成点云的。遇到疑问优先查看 README 的 FAQ 与python scripts/run_demo.py --help它们覆盖了绝大多数常见问题。从换一个场景就要重新微调到任何陌生环境开箱即用FoundationStereo 迈出的这一步让我们离机器像人眼一样看世界的愿景更近了一点。希望这份指南能帮你顺利迈出第一步剩下的就交给你的想象力了。【免费下载链接】FoundationStereo[CVPR 2025 Best Paper Nomination] FoundationStereo: Zero-Shot Stereo Matching项目地址: https://gitcode.com/gh_mirrors/fo/FoundationStereo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考