点击下方卡片关注“CVer”公众号AI/CV重磅干货第一时间送达点击进入—【顶会/顶刊】投稿交流群添加微信号CVer2233小助手拉你进群扫描下方二维码加入CVer学术星球可以获得最新顶会/顶刊上的论文idea和CV从入门到精通资料及应用发论文/搞科研/涨薪强烈推荐双目立体匹配Stereo Matching作为 3D 视觉领域的经典核心问题至今已有 50 年的研究历史。近年来随着深度学习的爆发各大公开数据集如 KITTI、Middlebury的榜单不断被刷新。然而传统的算法大多陷入了“域偏移Domain Gap”的泥沼——在一个场景训练的模型换到另一个场景往往性能骤降需要昂贵的重新微调。为了解决泛化性问题以英伟达 FoundationStereo 为代表的“立体匹配基础大模型”横空出世。这类模型通过引入单目视觉基础大模型如 DepthAnythingV2的先验知识实现了惊人的零样本泛化Zero-shot Generalization能力。但代价是高昂的计算成本在 RTX 3090 上单帧推理耗时近 500ms~2 FPS这对于极度依赖实时 3D 感知的机器人操作、无人机避障和自动驾驶来说显然是不可接受的。为了打破 3D 视觉中“强泛化必伴随高延迟”的魔咒英伟达研究团队Bowen Wen, Stan Birchfield 等重磅推出了全新架构——Fast-FoundationStereo。该模型通过创新的分而治之加速策略在保持顶级大模型零样本泛化能力的同时首次实现了实时推理速度飙升 10 倍以上TensorRT 优化下可达 21ms约 47 FPS。该工作已被 CVPR 2026 接收模型、代码与海量伪标签数据集即将全面开源。 核心技术解析如何对 3D 匹配流水线进行“极限瘦身”在 3D 视觉中立体匹配通常包含特征提取、3D代价体滤波Cost Volume Filtering和视差细化等阶段。Fast-FoundationStereo 摒弃了从头设计轻量化网络的传统做法转而将强大的教师模型FoundationStereo进行全方位的深度压缩1. 混合 3D 几何与语义先验的特征蒸馏教师模型需要同时运行单目大模型DepthAnythingV2和双目 CNN 来提取特征算力开销巨大。Fast-FoundationStereo 通过特征蒸馏Knowledge Distillation将这两股庞大的混合先验信息直接“注入”到一个轻量级的单一学生网络骨干中。 3D视觉亮点实验表明经过蒸馏的学生网络不仅完美继承了对高频边缘的几何感知能力在面对 3D 重建中的“老大难”问题——半透明材质如玻璃门或高反光表面时依然能输出高度一致且锐利的深度图。2. 3D 代价体滤波的高效“分块架构搜索 (NAS)”**3D代价体3D Cost Volume是立体匹配中计算最密集的瓶颈。由于代价体的通道维度本来就很小通常少于100常规的剪枝操作会直接导致匹配精度的灾难性崩塌。 为了攻克这一难题研究人员利用神经网络架构搜索NAS**寻找最优解。他们将滤波网络划分为多个独立的 Block进行局部蒸馏。随后结合整数线性规划ILP在给定的毫秒级延迟预算下瞬间从高达 $5.8 \times 10^{19}$ 种代价体滤波器组合中筛选出最优的非直觉网络架构。3. 针对视差迭代细化的结构化剪枝在最后的视差迭代细化Iterative Refinement阶段网络使用了循环门控单元ConvGRU。研究团队针对 ConvGRU 中隐藏状态Hidden States的循环传递特性构建了特有的“依赖关系图Dependency Graph”。通过一阶泰勒展开评估参数的全局重要性执行了结构化剪枝并微调恢复精度使最终模型能无缝接入 TensorRT 等底层硬件加速库。 3D 数据引擎基于法线一致性的 140 万伪标签流水线在 3D 视觉的实际落地中合成数据Synthetic Data与真实物理世界始终存在“Sim-to-Real”的鸿沟。为了让模型在真实世界中拥有强大的零样本泛化力团队利用互联网上庞大的野生双目视频Stereo4D 数据集构建了一条极具巧思的自动化伪标签Pseudo-Labeling清洗流水线1.3D 表面法线一致性校验团队利用强大的教师立体匹配模型和优秀的单目深度估计模型同时对左图进行深度预测。由于两者机理不同团队将这两种深度图反投影Unprojection并利用 Sobel 算子转化为 3D 表面法线图计算两者像素级的余弦相似度。只有法线高度一致的区域才被保留。2.天空与无效区域过滤在 3D 几何中天空属于无限深区域团队利用开放词汇分割大模型如 SAM 2生成天空掩码剔除这些在双目视差中极易产生歧义的无穷远区域并过滤掉含有字幕或马赛克的劣质视频帧。3.最终产出该流水线最终提炼出了高达 140万对1.4M 的高质量“野外”真实场景双目伪标签极大地增强了学生模型在无先验场景下的深度预测鲁棒性。 榜单表现实时赛道的绝对碾压研究团队在众多 3D 视觉公认的权威测试基准未参与训练的数据集如 Middlebury, ETH3D, KITTI, 以及专攻高难度材质的 Booster 数据集上对模型进行了纯粹的“零样本Zero-shot”泛化测试·碾压现有实时算法在与 RT-IGEV、LightStereo-L、BANet3D 等最新实时立体匹配模型的对比中Fast-FoundationStereo 的错误率呈现断崖式下降例如在 Middlebury 上远超其他实时方案。·媲美“重型”基础模型尽管推理时间仅需 21ms TensorRT 环境其预测精度依然能够逼近运算时间长达数十倍的非实时大模型如原版 FoundationStereoStereoAnywhere。·出色的物理世界感知无论是面对自动驾驶场景中的室外强光还是室内机器人抓取中常见的无纹理白墙、透明玻璃杯和反光金属该模型都能输出极其平滑且边界锐利的深度估计。 结语长久以来3D 视觉工程师们一直在“笨重的高精度泛化模型”与“脆弱的轻量化实时模型”之间做艰难的妥协。英伟达 Fast-FoundationStereo 的出现证明了通过深度的系统级优化先验蒸馏、3D代价体NAS、法线一致性数据引擎具身智能、无人机与自动驾驶完全可以在毫秒级的延迟下获得等同于大模型的 3D 零样本感知能力。论文:https://arxiv.org/abs/2512.11130项目网页:https://nvlabs.github.io/Fast-FoundationStereo/代码、模型与数据集:https://github.com/NVlabs/Fast-FoundationStereo 团队介绍英伟达主任研究科学家**温伯文Bowen Wen**及其团队成员 Shaurya Dewan、Stan Birchfiel 共同完成了本文。作为 3D 视觉与具身智能领域的资深专家温伯文目前在 NVIDIA Research 主导大模型相关研究。他过往资历深厚曾先后在谷歌 X、Meta Reality Labs 及 Amazon Lab126 留下研究足迹。其学术成果曾获 CVPR 和 RSS 最佳论文提名并在开源社区极具影响力主持开发了 FoundationPose、BundleSDF 和 MimicGen 等多项前沿项目。何恺明在MIT授课的课件PPT下载在CVer公众号后台回复何恺明即可下载566页课件PPT大家赶紧学起来CVPR 2026 所有论文和代码下载在CVer公众号后台回复CVPR2026即可下载CVPR 2026 所有论文和代码CV垂直方向和论文投稿交流群成立扫描下方二维码或者添加微信号CVer2233即可添加CVer小助手微信便可申请加入CVer-垂直方向和论文投稿微信交流群。另外其他垂直方向已涵盖目标检测、图像分割、目标跟踪、人脸检测识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿交流、PyTorch、TensorFlow和Transformer、NeRF、3DGS、Mamba等。 一定要备注研究方向地点学校/公司昵称如Mamba、多模态学习或者论文投稿上海上交卡卡根据格式备注可更快被通过且邀请进群▲扫码或加微信号: CVer2233进交流群 CVer计算机视觉知识星球人数破万如果你想要了解最新最快最好的CV/DL/AI论文、实战项目、行业前沿、从入门到精通学习教程等资料一定要扫描下方二维码加入CVer知识星球最强助力你的科研和工作 ▲扫码加入星球学习▲点击上方卡片关注CVer公众号 整理不易请点赞和在看