阿里千问开源Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

2026-09-07 18:47:35   |   文白不白   |   4636

9月7日,阿里千问宣布开源Qwen-Drive-1.0-4B,这是一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。

官方表示,该模型是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了3D感知与视觉问答,并扩展至运动规划,同时完整保留了预训练VLM的原始架构。模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时保留通用视觉理解与指令遵循能力。

Qwen-Drive-1.0-4B同时提供SFT和RL两个规划专家,官方评测覆盖3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

据介绍,该模型仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。SFT模型在所有基准上已具备竞争力。经过强化学习后,模型以微小的开环位移误差为代价,换取了在人类偏好对齐和闭环安全性方面的全面提升。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阿里千问开源Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

2026-09-07 18:47:35 浏览量: 4636 作者: 文白不白

9月7日,阿里千问宣布开源Qwen-Drive-1.0-4B,这是一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。

官方表示,该模型是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了3D感知与视觉问答,并扩展至运动规划,同时完整保留了预训练VLM的原始架构。模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时保留通用视觉理解与指令遵循能力。

Qwen-Drive-1.0-4B同时提供SFT和RL两个规划专家,官方评测覆盖3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

据介绍,该模型仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。SFT模型在所有基准上已具备竞争力。经过强化学习后,模型以微小的开环位移误差为代价,换取了在人类偏好对齐和闭环安全性方面的全面提升。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号