Qwen-Drive-1.0 : une exploration préliminaire vers un modèle fondationnel vision-langage pour la conduite autonome
Nous proposons Qwen-Drive-1.0. Il s'agit du premier modèle fondationnel vision-langage pour la conduite autonome qui unifie la perception 3D et le question-réponse visuel dès la phase de pré-entraînement, puis s'étend à la planification de mouvement, tout en conservant l'architecture VLM pré-entraînée inchangée de bout en bout. Le modèle repose sur Qwen3.5-4B, nativement multimodal, et ajoute deux modules externes. La tête de perception BEV sert de sonde 3D explicite et inspectable, et réalise conjointement la détection d'objets 3D, la prédiction d'Occupancy sémantique et la segmentation de carte BEV. L'expert en planification génère les trajectoires futures du véhicule ego par correspondance de flux. Grâce à un entraînement par étapes, nous améliorons significativement les capacités de conduite autonome du VLM généraliste, et nous validons sa faisabilité sur les tâches de perception 3D, de question-réponse visuel de conduite et de planification de mouvement, formant ainsi un modèle vision-langage unifié pour la conduite autonome, qui fournit une nouvelle génération de base VLM pour l'adaptation aux scénarios de conduite.
















