wizwand 4小时前 · 2026-08-31 18:16:06 · 0 阅读
ZoeDepth:结合相对深度与度量深度的零样本迁移
本文研究单目图像深度估计问题。现有方法通常侧重于两类目标:一类关注泛化能力,但不考虑真实尺度,即相对深度估计;另一类在特定数据集上追求最先进结果,即度量深度估计。本文首次将这两者结合起来,在保留度量尺度的同时,实现出色的泛化能力。我们的旗舰模型 ZoeD-M12-NK 先使用 12 个数据集进行相对深度预训练,再使用两个数据集进行度量深度微调。针对每个领域,我们采用轻量级预测头,并引入一种名为 metric bins 模块的新型 bin 调整设计。在推理阶段,模型通过潜在分类器将每张输入图像自动路由至合适的预测头。根据相对深度预训练和度量深度微调所使用的数据集不同,该框架支持多种配置。即使不进行预训练,我们也能在 NYU Depth v2 室内数据集上显著刷新 SOTA。先在 12 个数据集上预训练,再在 NYU Depth v2 室内数据集上微调后,模型在相对绝对误差(REL)指标上进一步提升 SOTA,总体改善达 21%。最后,ZoeD-M12-NK 还是首个能够在多个数据集(NYU Depth v2 和 KITTI)上联合训练、且性能不会明显下降的模型,并且在室内和室外领域的 8 个未见数据集上实现前所未有的 zero-shot 泛化能力。代码和预训练模型已公开发布于 https://github.com/isl-org/ZoeDepth 。
Shariq Farooq Bhat、Reiner Birkl、Diana Wofk、Peter Wonka、Matthias Müller · 2023
相关基准
任务数据集| 任务 | 数据集 | 结果 | 排名 | 结果 ↓ |
|---|---|---|---|---|
| 单目深度估计 | KITTI (Eigen) | Abs Rel0.054 | 552 | |
| 深度估计 | NYU v2 (test) | Threshold Accuracy(delta < 1.25)95.5 | 438 | |
| 单目深度估计 | NYU v2 (test) | Abs Rel0.075 | 327 | |
| 深度估计 | KITTI(Eigen 划分) | RMSE2.29 | 291 | |
| 视频深度估计 | Sintel | Delta 阈值精度(1.25)47.3 | 235 | |
| 深度估计 | NYU Depth V2 | RMSE0.27 | 226 | |
| 单目深度估计 | KITTI | Abs Rel0.054 | 220 | |
| 单目深度估计 | KITTI(Eigen 划分) | Abs Rel0.054 | 215 | |
| 单目深度估计 | NYU V2 | Delta 1 准确率97.3 | 192 | |
| 深度估计 | KITTI | RMSE2.281 | 184 |
原始来源: wizwand