阿里千问开源 Qwen-Drive-1.0-4B:面向自动驾驶的视觉语言基础模型
据 IT之家 9 月 6 日消息,阿里千问本周开源了 Qwen-Drive-1.0-4B。来源显示,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型,官方将其定位为首个面向自动驾驶的视觉语言基础模型。与传统仅聚焦感知或规划的自动驾驶模型不同,Qwen-Drive-1.0 在预训练阶段尝试把 3D 感知、视觉问答以及后续的运动规划能力放在同一框架中处理,同时保留原有预训练视觉语言模型的架构。
对于中文 AI 与自动驾驶产业观察而言,这一开源动作的重点不只是“又一个模型发布”,而是视觉语言模型正在从通用图文理解,进一步进入高约束、高风险的具身智能与驾驶决策场景。Qwen-Drive-1.0-4B 的出现,也反映出基础模型路线正在向自动驾驶研发链条延伸。
统一 3D 感知、视觉问答与运动规划
官方介绍称,Qwen-Drive-1.0 在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展到运动规划任务。这意味着模型不仅需要理解道路、车辆、行人等视觉环境,还要能围绕驾驶场景回答问题,并对车辆未来运动给出规划结果。
来源显示,该模型采用分阶段训练方案,将驾驶监督数据与通用视觉语言数据结合。这样的设计目标在于:一方面让模型获得驾驶场景所需的专门能力,另一方面尽量保留原有视觉语言模型的通用视觉理解能力和指令遵循能力。对于自动驾驶模型而言,这一点较为关键,因为真实道路环境并非单一任务集合,而是涉及开放世界中的多模态理解、规则判断和行为选择。
Qwen-Drive-1.0-4B 同时提供 SFT 和 RL 两个规划专家版本。简单理解,SFT 版本更侧重通过监督微调学习已有轨迹与决策模式;RL 版本则在此基础上引入强化学习优化,使模型在规划结果上进一步向人类偏好和安全性目标靠拢。
- 模型基础:基于 Qwen3.5-4B 构建,延续预训练 VLM 的原始架构。
- 能力范围:覆盖 3D 感知、驾驶场景理解、通用视觉语言能力和运动规划。
- 训练路线:结合驾驶监督数据与通用视觉语言数据,采用分阶段训练。
- 规划专家:提供 SFT 与 RL 两类版本,用于不同规划能力评估。
评测覆盖开环、伪闭环与闭环规划
在评测方面,官方称 Qwen-Drive-1.0-4B 覆盖了 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。对于自动驾驶系统来说,开环评测通常更关注模型对已有数据轨迹的预测能力,而闭环评测更接近真实驾驶中的连续交互,能够反映规划输出对后续环境变化和安全性的影响。
来源还提到,Qwen-Drive-1.0 仅使用公开来源构建规划样本,并统一了各数据集的轨迹格式。这对于开源社区具有现实意义:自动驾驶数据长期存在格式分散、任务定义不统一、复现实验门槛高等问题。如果一个模型能够在公开来源基础上完成规划样本构建,并提供统一轨迹格式,将有助于研究者在同一框架下对不同数据与规划方法进行比较。
据介绍,SFT 模型在所有基准上已经具备竞争力;经过强化学习后,模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。这一表述说明,RL 版本并非单纯追求离线预测指标,而是更强调实际驾驶规划中与安全和偏好相关的综合表现。
影响与解读:自动驾驶大模型进入“可复现基础设施”阶段
从产业趋势看,Qwen-Drive-1.0-4B 的价值在于把自动驾驶中的感知、理解、问答和规划放入一个视觉语言模型框架中讨论。过去,自动驾驶系统往往由多个模块组成,包括感知、预测、规划和控制等;而基础模型路线希望通过更统一的表征和训练方式,减少模块之间的信息断层。
当然,开源模型并不等同于可直接上车部署。自动驾驶场景对安全、实时性、鲁棒性和法规合规要求极高,任何模型从实验评测走向实际车辆系统,都需要经过大量工程验证。但对于科研机构、开发者和自动驾驶算法团队来说,Qwen-Drive-1.0-4B 提供了一个面向驾驶场景的开源 VLM 起点,有助于推动 自动驾驶基础模型 的可复现研究。
更广义地看,视觉语言模型正在从“看图回答问题”走向“理解环境并参与决策”。Qwen-Drive-1.0-4B 将运动规划纳入模型能力范围,代表多模态大模型与具身智能、机器人、智能汽车等方向的交汇正在加速。随着更多公开模型、数据格式和评测体系出现,自动驾驶算法研发可能会从封闭系统竞争,逐步转向基础模型能力、数据工程和安全评估体系的综合竞争。