← 文章 / AI技术
雷锋网 2小时前 · 2026-09-17 13:18:51 · 1 阅读

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026学习模型已经具备很强的局部视觉先验,而 3D 几何可以帮助建立跨视角、长距离的全局一致性。二者如何结合,是 3D 视觉与空间智能中的重要问题。

    编辑丨岑峰

在生成式 AI 的快速发展中,Sora 等视频和图像扩散模型(Diffusion Models)展示了很强的视觉生成能力。大规模 2D 数据让模型学到了丰富的视觉与语义先验,在单帧和局部视频生成上取得了显著进展。但当任务进一步要求多视角、长距离的 3D 一致性时,仅依赖数据驱动的局部先验仍会遇到挑战。

与此同时,在 3D 视觉和场景生成中,一个长期问题是如何把局部生成结果组织成全局一致的 3D 世界。现有视觉大模型在某些场景中仍可能出现跨视角结构不一致、物体数量或布局不合理等现象。

例如,当提示词中出现“卧室”时,模型有时会生成多张床;当虚拟相机在生成场景中进行较长距离漫游时,也可能出现建筑结构逐渐扭曲等问题。这些现象说明,模型从数据中学到的局部先验非常强,但对全局 3D 结构的约束仍然不足。引入显式的 3D 几何,可以为这些局部预测提供跨视角的结构约束,帮助构建更一致的全局结果。

在今年的欧洲计算机视觉国际会议(ECCV)上,香港科技大学教授谭平围绕这一问题介绍了团队近期在 3D 重建与 3D 场景生成方面的工作:学习方法提供强大的局部先验,3D 几何则用于组织和约束这些预测,从而提升大规模场景中的全局一致性与可扩展性。

谭平师从国际 3D 视觉泰斗权龙教授,长期从事 3D 视觉研究。本次演讲延续了这一方向,重点讨论如何把学习方法的表达能力与多视图几何、全局优化等经典 3D 方法结合起来。

在演讲中,谭平教授将 3D 重建与 3D 场景生成放在同一框架下讨论:无论是从图像重建 3D 世界,还是生成可漫游的 3D 场景,学习模型已经能够提供非常强的局部先验;而要把这些局部结果组织成全局一致的 3D 表示,几何结构与全局优化仍然具有重要作用。

在重建任务中,前馈网络高效且鲁棒,但在大规模输入和高精度位姿估计上仍有计算与一致性问题;团队借鉴视觉 SLAM/SfM 的关键帧思想,并结合集束调整(Bundle Adjustment)进行全局优化。在生成任务中,则通过显式 3D 布局或 3D 代理(Proxy)提供结构约束,再利用生成模型补充外观与细节,从而改善大场景漫游时的空间一致性。

这场演讲想强调的并不是学习方法与几何方法的二选一,而是二者的互补性:学习模型擅长从大规模数据中获得强大的局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能,这种“学习先验 + 几何约束”的结合值得进一步探索。

以下是谭平教授的演讲分享,AI科技评论根据其英文演讲内容进行了不改原意的编辑:几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

▎演讲标题:《几何的反攻:规模化 3D 重建与结构化 3D 场景生成》

(Geometry Strikes Back: Scaling 3D Reconstruction and Structuring 3D Scene Generation)演讲者: 香港科技大学 谭平

今天我将分享我们近期在 3D 视觉和 3D 场景生成方面的工作。近年来,以 VGGSfM(或 DUSt3R 类前馈网络)为代表的基于大型 Transformer 的方法取得了很大进展。这类方法的基本思路非常直观:接收一组输入图像,提取特征,然后通过大型 Transformer 直接估计相机位姿、深度图和点云,并获得很强的局部 3D 重建效果。

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026然而,我们注意到这类方法存在一个明显的计算瓶颈。我们统计了网络在处理不同数量图像时的 GPU 内存使用情况,通常情况下,在消费级 GPU 上很难一次处理超过 100 张图像。

01


大规模 SfM 方法:用“神经场景表示”

缓解 Transformer 的显存瓶颈

因此,我们希望从借鉴传统的SfM(运动恢复结构)与视觉SLAM的理念,在SLAM中我们会刻意将建图和追踪线程分开。建图是一个计算成本极其高昂的过程,因此通常只在少数的关键帧上执行;而对于海量的非关键帧,系统只执行计算负担极小的定位操作。几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026我们的大规模 SfM 方法正是脱胎于这一核心思想:我们是否可以利用前馈网络,先构建出某种高效的“神经场景表示(Neural Scene Representation)”作为 3D 地图,然后以此来大幅简化其余帧的计算?以下是我们的系统流程图。首先从从海量输入图像中均匀采样出一部分关键帧,我们称之为锚点帧,将其送入前馈网络获取初始的 3D 结构。最核心的一步在于“Token 采样”:在完成帧间注意力计算后,我们打破了每帧保留固定 Token 的常规做法,引入了随机性策略,为每张图像随机保留 20% 到 50% 的 Token,并将所有关键帧的这些 Token 聚合成一个单一的、全局的“场景表示”。几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

这一轻量化设计显著降低了全局建模时的显存开销,使方法能够扩展到更大规模的输入图像。

有了这个轻量级的高维“3D 地图”,对于所有庞大的非关键帧,我们只需通过帧间注意力机制与该场景表示进行交互,执行全局注意力计算,就能直接得出其相机位姿、深度图和点云。这里是一些结果的可视化。

我们的方法能够处理更大规模的图像,并生成稠密、合理的 3D 点云与相机轨迹;与基线相比,因位姿不准导致的“重影”等伪影明显减少。在 Tanks and Temples 等复杂数据集的测试中,大约 70% 的情况下,相对旋转和相对平移误差都能控制在 5 度以内。

这是视觉渲染结果。我们可以看到点云非常合理,而且相机轨迹与真实值高度吻合。

我还想分享一个关于“评估标准”的发现。过去,很多工作会把传统标杆算法 COLMAP 算出的相机位姿作为参考真值。但我们的研究也发现,COLMAP 本身存在估计误差,因此将其直接视为绝对真值也有一定局限。

为此,我们提取 90% 的输入图像,用我们的方法估计位姿并训练一个 NeRF 模型;最后在预留的 10% 未见视角上计算渲染图像的 PSNR(峰值信噪比)。结果显示,我们的方法在渲染质量和 PSNR 指标上优于以 COLMAP 位姿训练得到的结果。

02


Global 3R:

前馈网络与全局 SfM 的融合

至此,我们实现了前馈 3D 重建的规模化扩展。但在更大场景中,单纯依靠前馈预测仍可能出现误差累积和尺度不一致的问题。

于是我们提出第二个问题:能否将神经网络前馈方法的鲁棒性和效率,与传统全局 SfM 优化的几何精度结合起来,使系统同时兼顾可扩展性与全局一致性?

这就引出了我们近期的另一项工作Global 3R几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026其基本流程是:
  • 给定输入图像,首先提取滑动窗口。在每个滑动窗口内,应用前馈神经网络(例如类似CroCo/RoMa匹配网络)计算图像对之间的相对运动和点云等信息;
  • 接着,采用新方法在窗口内选择关键帧,并计算该关键帧与窗口内所有其他帧的匹配与对齐,从而获取一致的特征轨迹(feature track);
  • 构建位姿图,依次进行旋转平均和平移平均,最后执行集束调整,生成最终的3D结果。
几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026当前方案的优势在于无需指定固定的参考帧,能够灵活选择任意局部窗口作为参考。求解相对运动并选定关键帧后,我们通过形变操作将其余帧特征对齐至关键帧,并计算对齐置信度。可视化结果表明,对应帧向关键帧形变的效果在多数情况下非常合理,结合形变置信度,该方法能够有效筛选出最终的高质量匹配结果。优化过程表明,集束调整(BA)对3D点云质量的提升十分显著。在仅进行运动平均时,重建画面会出现重影(如同一物体被重复重建);而在BA优化过程中,特征逐渐对齐融合,最终生成结构一致的3D点云模型,并能清晰呈现相机的位姿轨迹。当前,学界也有许多研究者在探索相似的融合思路,例如苏黎世联邦理工学院(ETH)将深度学习与全局SfM结合的相关工作。在位姿精度评估方面,我们通过新视角合成,在Tanks and Temples数据集预留的10%图像上计算PSNR。结果显示,该方法在预留图像上取得了最高的PSNR,超越了包括COLMAP及其他先进前馈网络在内的所有基线方法。从NeRF新视角合成的结果来看,本方法生成的渲染图在细节上更接近真实图像。

在相机位姿精度方面,ETH3D 数据集上 1 度阈值下的结果表明,本方法取得了很高的旋转精度,在多个场景测试中该指标可达到 100%。

进一步的误差分析揭示了本方法精度更高的原因。以1度以内的相对旋转误差图表为例:初始网络预测仅有约70%的图像对达标,后续运动平均的改善有限;而严谨的几何优化即集束调整(BA),将精度从70%显著跃升至90%以上。这种几何约束在相对平移误差上的提升更为显著:运动平均后精度仅约35%,经集束调整后直接翻倍,提升至70%以上。

03


3D 场景生成:用“显式布局”

增强全局空间一致性

接下来是3D场景生成。当前图像和视频扩散模型已擅长生成高质量单帧和局部一致的片段。我们将介绍如何利用3D几何作为约束,将这些局部画面拼接成完整的3D世界,主要涉及三项工作。

首先是受 Text2Room 启发的两项研究。Text2Room 能根据文本生成 3D 房间,其思路是利用图像扩散模型逐步生成不同视角,最终拼接成全景图。不过,由于生成过程主要在局部视角上调用扩散模型,缺少显式的全局 3D 场景布局(scene layouts)约束,因此有时会出现家具数量或空间布局不合理的问题。

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026为此,我们在近期发表的ControlRoom工作中引入了显式布局生成,将生成过程解耦为“布局生成”和“外观生成”两阶段。第一阶段,训练扩散模型根据文本生成由边界框(bounding boxes)和语义组成的3D房间布局,并渲染出语义全景图。第二阶段,将该语义布局作为控制信号(ControlNet),指导高保真全景图的生成,以用于后续的3D可视化。

在布局生成环节,模型使用向量编码物体的坐标、尺寸和方向,并拼接为统一代码序列。基于该代码空间和真实结构化数据训练扩散模型,同时引入视觉先验以学习房间陈设的常见规律(如卧室通常包含床等家具)。此外,为改善外观渲染时全景图左右边界的衔接,我们在扩散过程中引入随机循环平移(random circular shift),显式增强循环一致性。对比测试表明,没有显式布局约束时可能出现一间卧室生成多张床等不合理结果,而布局引导有助于生成更合理的家具配置。

尽管ControlRoom效果显著,但仍存在局限:一是仅生成固定全景图,存在视角盲区,无法实现真正的自由3D漫游;二是受制于现有3D数据集规模(如Structured3D仅含两万个房间),场景与物体丰富度不足。这促使了我们的第二项工作SpatialGen。几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026为突破数据瓶颈,我们发布了规模提升一个数量级的SpatialGen数据集。它涵盖1.2万个场景、5.7万个房间,包含62个物体类别的约100万个边界框。此外,数据集提供了约500万张包含RGB、语义/实例分割、反照率图、深度图和法线图等6种模态的渲染图像,可广泛应用于场景生成与理解。基于该数据集,SpatialGen提出了一种“布局引导(layout-guided)”的多视角多模态扩散模型。模型输入3D布局与参考图像(或文本),联合训练生成RGB图像、语义图像,以及由“场景坐标图(scene coordinate maps)”编码的3D绝对几何信息。这种空间信息对维持多视角和模态一致性至关重要。随后,不同视角的图像被迭代融合至3D高斯(3D Gaussian)模型中。推理新局部视角时,通过投影3D高斯模型进行反向引导生成。该方法不仅能构建高质量3D场景,还支持强大的风格迁移,可在相同3D布局下生成欧式、中式或赛博朋克等截然不同风格的房间。在此基础上我们发现,SpatialGen强制要求输入显式3D布局的设定在实际应用中缺乏灵活性(用户通常只提供单张图片),且局限于结构性较强的室内场景。这一痛点为我们指明了下一步的技术进化方向。

04


SpatialCraft:单图推断 3D 代理,

解锁大场景的自由漫游

我们的第三项工作 SpatialCraft 进一步面向上述局限,采用两阶段策略。

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

第一阶段从单图生成 3D 代理(3D proxy)。通过在大量 3D 场景上训练的扩散模型,从单图推断出粗略的 3D 空间基底;在此基础上设置相机轨迹并渲染基础的 3D 漫游视频。第二阶段再引入视频扩散模型(video diffusion model),对基础视频进行 refinement,进一步提升纹理细节和视觉质量。

在第一阶段的技术细节中,核心是保持“像素对齐(pixel alignment)”以保留原始输入图像的特征。具体做法是将输入图像提升为深度图并转换为 3D 体素(voxels),利用网络补全场景中的不可见区域。这样可以让生成过程在可见区域与输入图像保持对齐,并为后续视角生成提供较稳定的 3D 结构;随后这些体素会被进一步处理为场景的 3D 高斯表示。

第二阶段则更侧重于“视频优化(video refinement)”。3D 代理已经提供了基础场景结构,可以对跨视角的空间关系形成约束;在此基础上,视频扩散模型重点优化画面的纹理细节和视觉质量。

实验结果表明,该方法不仅适用于室内场景,也能扩展到室外自然场景。即使相机进行较大范围移动,生成的漫游视频仍能较好保持空间一致性;在长视频生成测试中,相比现有基线,远离初始视角后仍能保持更稳定的场景结构。

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

总结而言,本次分享聚焦 3D 重建与 3D 场景生成两大方向。在 3D 重建中,深度学习前馈方法提供了强大的运动和结构先验,而多视图几何优化(如集束调整 BA)可以进一步提升全局精度与一致性。在 3D 场景生成中,现有大模型具备很强的局部生成能力,显式 3D 几何约束则有助于减少不合理结果,并支持更稳定的多视角与长距离生成。

因此,我更愿意把 3D 几何理解为连接“重建”与“生成”的脚手架(scaffold):基于学习的大模型为我们提供强大的局部先验,而经典几何帮助把这些局部信息组织成全局一致的 3D 结构。

非常感谢大家的聆听!

为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

几何的「反攻」!港科大谭平:从局部先验到全局一致,3D 几何如何增强视觉大模型 | ECCV 2026

扫描上方二维码

或点击「阅读原文」关注雷峰网(公众号:雷峰网)专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

原始来源: 雷锋网

评论 (0)