← 文章 / AI技术
Apple 机器学习 3小时前 · 2026-08-31 13:10:23 · 0 阅读

超越视觉思维链:面向主动视频推理的内化视觉思考

作者:Xiaoyu Zhu、Xinke Deng、Suresh Taddewadikar、Arnab Kumar Mondal、Zhongyu Jiang、Ian Fasel、Joerg Liebelt

查看论文

多模态大语言模型越来越多地借助视觉思维链(Visual CoT)来对空间、时间及具身环境进行推理。通过生成中间的推理图像,视觉思维链为视觉预见提供了一种直观的机制,但也带来了显著的推理开销,这在主动视频推理场景下尤为棘手。我们由此提出一个问题:模型能否在训练阶段就学会"用视觉思考",而在推理时直接给出答案?为此,我们提出了内化视觉思考(Internalized Visual Thinking,IVT),一个在无标注视频上联合优化文本预测与下一嵌入预测的后训练框架。给定一段部分可观测的视频,IVT 同时预测未来帧的潜在表征与目标文本答案,促使模型捕捉运动、物体状态变化、交互以及潜在意图。在推理阶段,IVT 无需合成或重新编码未来帧,直接生成答案。我们围绕目标表征、解码器设计、预测时窗、数据配比、训练课程以及预测目标进行了受控实验。在全部六类评测设置下,IVT 都优于纯文本后训练,同时保持了同等高效的推理流程。与视觉思维链相比,IVT 取得了相当或更好的性能,并将端到端延迟降低了 5 倍以上。我们的研究表明,视觉思维链在推理时进行显式像素级生成的范式,对于主动视频推理而言并非必需。预测式的世界建模可以在训练阶段被内化,从而训练出既更准确又显著更高效的多模态推理器。

原始来源: Apple 机器学习

评论 (0)