Qué se ha publicado

El equipo Qwen de Alibaba ha publicado Qwen-Drive-1.0-4B, un modelo abierto de visión-lenguaje para conducción autónoma que combina la comprensión de una escena de tráfico con la planificación del siguiente movimiento del vehículo. El código, los pesos y los datos de demostración están disponibles bajo licencia Apache 2.0, y TechNode informó del lanzamiento el 7 de septiembre. El proyecto se desarrolló junto a la Universidad de Ciencia y Tecnología de Huazhong.

El artículo que lo acompaña, publicado en arXiv el 31 de agosto, lo describe como un primer paso hacia un modelo fundacional de visión-lenguaje para conducción, no como un producto acabado.

Un modelo, tres tareas

La decisión de diseño que subrayan los autores es lo que no cambiaron. Qwen-Drive está construido sobre Qwen3.5-4B, un modelo de visión-lenguaje nativamente multimodal, y la arquitectura preentrenada se deja intacta. Las capacidades de conducción se acoplan a su alrededor.

Una cabeza de percepción en vista de pájaro se encarga de la detección 3D de objetos, la predicción de ocupación semántica y la segmentación del mapa BEV. Un Planning Expert independiente se apoya en las mismas representaciones compartidas para generar la trayectoria futura del vehículo. El equipo distribuye dos variantes de planificación: una entrenada por imitación a partir de ejemplos de conducción y otra refinada con aprendizaje por refuerzo.

La vista a través del parabrisas de un coche hacia una calle urbana
El modelo integra percepción 3D, comprensión de escena y planificación de trayectoria. Imagen de archivo. Kao MHG · pexels · Pexels License

Por qué importa mantener intacto el VLM

Las pilas de conducción se han construido históricamente como cadenas: un módulo de percepción produce cajas y carriles, un planificador las consume, y los dos no comparten más que una interfaz. Funciona, y también significa que el planificador nunca ve lo que la percepción descartó.

Unificarlos en una sola representación es la apuesta actual del campo. El riesgo es que especializar un modelo general con datos de conducción destruya la capacidad general que lo hacía útil: la que le permite responder con palabras a “¿por qué has frenado aquí?”. Los autores sostienen que su receta de entrenamiento por etapas, que mezcla supervisión de conducción con datos generales de visión-lenguaje, lo evita: informan de una percepción 3D y una comprensión de escena sólidas conservando en gran medida la capacidad general de visión-lenguaje.

Las cifras de referencia son de los propios autores

El artículo informa de lo que llama un rendimiento de planificación de movimiento altamente competitivo en evaluaciones de lazo abierto, pseudo-cerrado y cerrado. Es una afirmación de los autores del modelo sobre su propio modelo, y todavía no se ha reproducido de forma independiente. Los pesos abiertos hacen posible esa reproducción, lo que es más de lo que puede decirse de la mayoría de los modelos de conducción.

Tráfico en una autopista de varios carriles visto desde arriba
Un Planning Expert independiente genera la trayectoria futura del vehículo. Imagen de archivo. Lee Campbell · pexels · Pexels License

El tamaño es el argumento

Cuatro mil millones de parámetros es poco. No es una limitación de la que haya que disculparse: es la razón por la que este lanzamiento interesa. Un modelo de conducción tiene que funcionar dentro de un vehículo, con un presupuesto de consumo y de latencia que un modelo de centro de datos nunca afronta, y 4B bajo Apache 2.0 es un tamaño que un laboratorio universitario o un proveedor mediano puede ajustar y desplegar de verdad.

También continúa un patrón. Alibaba lleva dos años publicando abiertamente los pesos de Qwen mientras sus homólogos occidentales publican artículos sobre modelos que nadie más puede ejecutar, y el efecto sobre quién hace la investigación derivada ha sido visible.

Qué vigilar

La evaluación independiente en los bancos de pruebas de lazo cerrado, que es donde los modelos de conducción suelen dejar de lucir. Y si algún programa de vehículos lo adopta: un modelo abierto que nadie mete en un coche es un artefacto de investigación, no un producto.