← 文章 / AI技术
The Decoder 6小时前 · 2026-09-07 20:48:33 · 5 阅读

Qwen-Drive 1.0 解释刹车原因,但解释未必匹配实际 maneuver

Image description

关键点

  • 阿里的 Qwen-Drive 1.0 将空间感知、交通问答和路径规划整合进单一 AI 模型中。
  • 两个用于 3D 建图和路径规划的模块扩展了基础语言模型,使 AI 既能充当驾驶系统,也能担任座舱助手,同时不丢失原有知识。
  • 重训练使车辆在仿真中偏离道路的概率从 24% 降至 12%。但该模型的 explanatory 并不总能与其驾驶决策保持一致。

Qwen-Drive 1.0 在一个模型中同时处理三项任务:环境空间感知、交通问答和路径规划。研究者证实,一个文本-图像模型并非只要会描述图片就自动理解三维空间。

现有驾驶模型通常基于通用文本-图像模型,并使用驾驶数据进行微调,主要为关于交通场景的问答对。据论文所述,这种方法有两个缺陷:仅基于交通问答训练出来的模型仍无法可靠地判断距离、位置和空旷区域;而一旦过度聚焦驾驶数据,模型就会因研究者称为“灾难性遗忘”(catastrophic forgetting)的现象丧失原始训练中获得的广泛通用知识,而这恰恰是在罕见且突发交通情境中最关键的那类知识。阿里研究部门构建的模型正是为了同时解决这两个问题。

独立模块用于检验模型是否真正理解空间

Qwen-Drive-1.0 建立在 2 月发布的 Qwen3.5-4B 之上,并增加了两个额外组件。第一个组件通过识别三维空间中的物体、判断哪些区域被占用以及追踪道路布局来生成周围环境的鸟瞰图。研究者指出,它同时也可作为测量工具,揭示模型实际从图像中提取了多少空间信息。

Architecture diagram of Qwen-Drive-1.0 showing the Vision Encoder, Qwen3.5 Language Model, external BEV Perception Head for 3D detection, occupancy, and map segmentation, plus a Planning Expert for trajectory output.
所有驾驶功能都经由一个共享的语言模型运行。两个新增模块接入其内部中间结果:一个负责构建环境的三维模型,另一个负责规划车辆未来几秒的行驶路线。| 图片来源:Qwen

第二个组件 Planning Expert 利用模型内部数据规划车辆的未来运动。研究人员起初只训练新增组件、保持视觉语言模型不动,结果空间精度依然很低——这说明一个能细致描述图像的模型,并不会自然而然地理解三维空间。只有当团队把视觉语言模型本身也拿来做空间任务训练后,性能才显著提升,也就是说,对交通场景的空间理解能力必须刻意构建进去。

Four scene rows with multi-view camera images, 3D object detection in bird's-eye view, semantic occupancy maps, and BEV map segmentation, each comparing the model's prediction against ground truth.
模型根据相机图像重建每个场景的鸟瞰图,展示车辆、行人和道路标线。右侧为预测结果与实际状况的对比。| 图片:Qwen

训练先从感知模块开始,再融合感知与问答,接着是路径规划,最后通过强化学习微调模型行为。针对视觉—语言部分,团队整合了 24 个公开的驾驶场景数据集。这些数据格式各异,且偶有误标注,因此借助 AI 模型统一了问答内容并与原始数据对齐。团队还自建了一些示例,解释车辆为何应做出特定驾驶决策,例如是哪个物体触发了刹车。

一套模型同时服务座舱与驾驶系统

在现代汽车中,信息娱乐系统与驾驶系统正逐步收敛到同一计算单元,而非各自运行在独立的控制器上。作者认为,用通用能力换取纯驾驶性能的做法在此并不适用,因为座舱仍需专用模型和额外算力来处理对话或开放式问答等任务。

Two radar charts comparing Qwen-Drive-1.0 against models like Qwen3.5-4B, MiMo-Embodied-7B, and InternVL3.5-8B across Driving VQA, General VQA, 3D Perception, and Motion Planning benchmarks.
在 Qwen 自身的评测中,Qwen-Drive 1.0 在多数驾驶和感知类别上击败了专用模型。| 图片来源:Qwen

据论文显示,Qwen-Drive 1.0 在交通场景问题上得分远高于未经修改的基础模型 Qwen3.5-4B。两者差距最明显的是需要解释因果关系的场景,比如为什么车辆应该刹车或转弯。通用知识方面表现同样稳定:模型在驾驶领域之外的测试中几乎没有退步,甚至在某些空间任务上略有提升。

从仿真到实地

在驾驶规划方面,团队在多个难度层级上测试了该模型,从简单预测一直延伸到误差会随时间累积的模拟器。在模拟器中,经过奖励重训练的模型将车辆偏离道路的概率从 24% 降至 12%,且驾驶更加谨慎,总体行驶里程也减少。

Three open-loop driving scenes with overlaid reasoning text and predicted trajectories at top, and eight closed-loop time steps from two AlpaSim runs with camera images and trajectory plots below.
在每个场景中,模型都会解释其驾驶决策,例如为躲避路上的动物而刹车,或在红灯前停下。蓝线表示规划路线。| 图片来源:Qwen

然而,模型的解释并不总能准确指向实际情况的真正原因。远处的红灯和一个突然走上马路的孩子需要截然不同的反应时间,而模型可能将两者混淆。此外,规划出的 maneuver 也未必与其事先给出的推理一致。部分结果基于作者设计或重建的测试流程,因此单项指标很难反映该系统在复杂真实驾驶环境中的表现。

Four scene rows with camera images from unfamiliar camera configurations in WOD-E2E and PAI-AV, showing 3D detection, occupancy, and map segmentation results without ground truth comparison.
模型在处理来自其他车辆、不同摄像头配置的影像时,检测效果明显下降,主要原因是缺少针对这些配置的训练数据。| 图片来源:Qwen

Qwen 团队用自己的 HopChain 基准测出了空间理解上的这个短板:视觉语言模型虽然在图文基准上得分不错,但在识别物体和空间关系时依然会出错。灾难性遗忘也是老问题了。2023 年 Google DeepMind 推出 PaLM-E(一个同时处理语言、图像和机器人控制的模型)时,较小的版本在完成机器人训练后语言能力大幅下降,而 5620 亿参数的最大版本几乎毫发无损。

把语言模型和驾驶功能绑定在一起,也带来了新的攻击面。UC Santa Cruz 的研究人员在摄像头视野里放了一块带标签的标牌,就骗过了 DriveLM 驾驶系统,让它朝正在过马路的行人偏转——尽管系统其实已经正确检测到了这些行人。目前研究重心正在转向 World Action Models,这类模型还能预测环境如何随智能体自身动作而变化。

Qwen 团队已将该模型免费开放给研究社区,可在 Hugging Face、ModelScope 和 GitHub 上获取。

原始来源: The Decoder

评论 (0)