开源|Qwen-Drive-1.0:打通感知、语言与规划的自动驾驶视觉语言基础模型
thinkindev • 2026-09-08
1702 views
QwenLM团队在GitHub开源了Qwen-Drive-1.0项目,定位为面向自动驾驶的视觉语言基础模型。该项目采用分阶段训练策略,将感知、语言理解和规划目标融合到统一框架中,使模型既能获得专业驾驶能力,又能保留广泛的视觉理解与指令跟随能力。与只关注单一驾驶任务的模型不同,Qwen-Drive强调通用视觉语言能力与自动驾驶场景的结合,有望为端到端自动驾驶、多模态人车交互以及可解释决策提供新的基础架构。官方建议使用24GB及以上显存的GPU进行推理或训练,降低了研究机构和开发者的使用门槛。这一项目反映出视觉语言模型正在加速进入自动驾驶领域,成为连接场景理解、规划决策与自然语言交互的重要技术路线。
核心要点
- QwenLM开源面向自动驾驶的视觉语言基础模型Qwen-Drive-1.0
- 采用分阶段训练策略融合感知、语言和规划目标
- 保留通用视觉理解与指令跟随能力,建议24GB以上显存运行