SevenTnewSNoticias de IA y tecnología, explicadas

Investigación en conducción autónoma

Qwen-Drive-1.0 obtiene 69,43 en QA de conducción y luego señala su propia brecha de razonamiento

Qwen-Drive-1.0 acopla una cabeza de percepción de vista de pájaro y un planificador de flow matching a un backbone Qwen3.5-4B intacto, y luego registra una media de 69,43 en QA de conducción. La propia conclusión del artículo señala lo que la puntuación oculta: un razonamiento que no siempre coincide con la trayectoria.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-09-15 · 5 min de lectura

Qwen-Drive-1.0 obtiene 69,43 en QA de conducción y luego señala su propia brecha de razonamiento

El resumen de Qwen-Drive-1.0 reclama una primicia de categoría: un modelo fundacional de visión-lenguaje para conducción autónoma que unifica percepción 3D y respuesta visual a preguntas en la etapa de preentrenamiento, y luego se extiende a la planificación de movimiento. Si se despoja del encuadre, la contribución se reduce a algo más específico. Tres capacidades comparten un único VLM preentrenado, con la percepción a cargo de una cabeza de vista de pájaro acoplada, la respuesta a preguntas por la vía del lenguaje y la generación de trayectorias por un módulo experto separado.

Un "primero" que la conclusión matiza

La conclusión usa un lenguaje más suave que el resumen. Allí, el mismo trabajo es "un paso inicial hacia un modelo fundacional de visión-lenguaje para la conducción autónoma". Ambas frases están en el mismo artículo. Lo que las separa es el alcance de lo que realmente se ha demostrado.

Nada en el material proporcionado indica contra cuántos sistemas se probó. El artículo reporta que su variante Qwen-Drive-1.0-SFT supera tanto a los VLM de propósito general como a los especialistas en conducción o embodied en QA de conducción, pero los extractos disponibles aquí no nombran ni uno solo de ellos.

Un backbone congelado con dos módulos que leen de él

Qwen-Drive-1.0 se asienta sobre Qwen3.5-4B, que el artículo describe como nativamente multimodal. Un codificador de visión y un VLM compartidos procesan imágenes de conducción de una y varias vistas, secuencias temporales de imágenes e imágenes generales. Dos módulos externos leen de esa vía compartida mientras la arquitectura preentrenada permanece como estaba.

El primero es una cabeza de percepción BEV. Construye una representación de vista de pájaro a partir de entradas de un solo fotograma y múltiples vistas, y se encarga de la detección de objetos 3D, la predicción de ocupación semántica y la segmentación de mapas BEV. El artículo la describe como una sonda 3D explícita e inspeccionable, y hace una afirmación arquitectónica más fuerte de lo que sugiere la palabra "cabeza". Sus pérdidas alimentan una vía de gradiente adicional hacia la vía visual compartida durante el entrenamiento conjunto, de modo que la cabeza de percepción escribe de vuelta en las características de las que lee.

Ese detalle está en ligera tensión con la promesa de una arquitectura dejada "totalmente intacta". Arquitectura y pesos son cosas distintas, y los gradientes pueden reescribir los pesos sin cambiar la topología, así que ambas afirmaciones pueden sostenerse a la vez. El artículo no dice qué lectura pretende.

El segundo módulo es el Planning Expert, un transformer de difusión adaptado a las representaciones del VLM que genera trayectorias del ego de 5 segundos mediante flow matching. Toma una razón de planificación textual como condición opcional, lo que significa que el lenguaje puede dirigir una maniobra, pero no es necesario para producir la trayectoria.

Qué dicen realmente 69,43 y 2,83 millones

Cifra reportadaValorQué le atribuye el artículo
Media de QA de conducción (Qwen-Drive-1.0-SFT)69,43Supera a VLM de propósito general y a especialistas en conducción o embodied, ninguno de ellos nombrado en los extractos disponibles
Muestras de entrenamiento2,83 millonesDatos totalmente públicos
Horizonte de trayectoria5 segundosPredicciones a 10 Hz
Módulos externos2La cabeza de percepción BEV y el Planning Expert
Modelo baseQwen3.5-4BNativamente multimodal; arquitectura preentrenada sin cambios

Qwen-Drive-1.0-SFT alcanza una media de 69,43 en QA de conducción, con dos decimales. El material proporcionado no ofrece un desglose por benchmark, así que no hay forma de ver qué tipos de preguntas sostienen esa media y cuáles la hunden. Las anotaciones entre conjuntos de datos diferían en estilo, y el equipo estandarizó el formato de trayectoria para producir predicciones estables de 5 segundos a 10 Hz.

Las 2,83 millones de muestras de entrenamiento provienen de datos públicos, lo que significa que no hay registros de flota propietarios y, en principio, una receta que otros laboratorios podrían intentar copiar. El tamaño del modelo base es donde la afirmación se vuelve interesante. El artículo no sostiene que un backbone más grande impulse las mejoras. Sostiene que el entrenamiento por etapas más dos módulos especializados elevan un modelo de propósito general hasta una media líder en QA de conducción en la evaluación que realizó.

Dos salidas que no coinciden

El artículo nombra su propio modo de fallo: "la consistencia entre el razonamiento textual y la trayectoria generada aún debe reforzarse, lo cual dejamos como foco de trabajo futuro".

Esa frase debería acompañar a todos los titulares con el 69,43. Un modelo que produce una justificación fluida para frenar y una trayectoria que hace otra cosa es más difícil de auditar que uno que no ofrece ninguna justificación, porque la explicación invita a una confianza que la trayectoria no se ha ganado.

La consecuencia para quien construya sobre esto es concreta. Una trayectoria se puede comprobar contra un simulador. Una frase no. Hasta que ambas se validen la una contra la otra, la supervisión de un sistema así recae únicamente en la trayectoria, y la salida de lenguaje queda como una comodidad en lugar de una pista de auditoría.

Por qué un modelo fundacional de conducción, y por qué empaquetado así

El artículo llega dentro de un paquete de material de Alibaba Cloud en el que Qwen se promociona comercialmente: una plataforma para construir aplicaciones sobre modelos como Qwen-Max, una herramienta de trabajo llamada QwenWork y un caso sobre el suscriptor de seguros con IA de Prudential ejecutándose en Alibaba Cloud. Publicar investigación junto a páginas de producto es práctica habitual entre proveedores que cortejan cuentas empresariales, y el material proporcionado no declara ninguna intención estratégica.

Lo que el artículo dice sobre la dirección es más acotado y más útil. Posiciona el modelo como una "base VLM de nueva generación para la adaptación a escenarios de conducción". Una base para adaptación es algo que otro equipo ajusta con fine-tuning, no un stack de conducción terminado, y la expresión "paso inicial" de la conclusión descarta la lectura más fuerte. La restricción de datos públicos encaja con esa postura. 2,83 millones de muestras inspeccionables hacen que una receta de entrenamiento sea reproducible de un modo en que los registros de flota nunca lo son.

La parte inacabada sigue siendo la que más importa. Un modelo unificado que aún no puede atar su razonamiento a su ruta ha demostrado que un solo VLM puede cargar con percepción, preguntas y planificación en los mismos pesos. No ha demostrado que los tres coincidan, que es lo que un sistema de conducción realmente tiene que acertar.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.