SevenTnewS

Agentes GUI

El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes

El Qwen-UI-Agent de Alibaba Tongyi Lab afirma obtener puntuaciones móviles de última generación (97.5% en AndroidDaily) y resultados competitivos en uso de computadora frente a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Su puntuación en el benchmark de dispositivos reales supera la de sandbox, mientras que el progreso parcial del 40% en OSWorld-v2 es el límite honesto.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-31 · Última actualización: 2026-08-02 · 3 min de lectura

El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes

Qwen-UI-Agent puntúa más alto en teléfonos reales que en el benchmark de sandbox que tiene al lado. Un informe técnico del Tongyi Lab de Alibaba, presentado el 30 de julio de 2026, registra un 92.2% en MobileWorld-Real, la prueba en dispositivo real, frente a un 82.1% en MobileWorld. El informe no explica la brecha, y es posible que las dos tareas no sean igual de difíciles. De cualquier manera, esa dirección es el argumento central del proyecto: un agente GUI construido para dispositivos que realmente existen.

El informe presenta a Qwen-UI-Agent como un "agente GUI fundacional centrado en el mundo real". Abarca móvil, uso de computadora, web y el entorno DeepSearch. No es un chatbot que describe lo que haría; el modelo opera la pantalla. Su espacio de acción unificado intercala operaciones de GUI con ejecución de línea de comandos y genera acciones por lotes en un solo turno del modelo, de modo que este planifica varios pasos a la vez en lugar de hacer una ida y vuelta por cada toque. Una capa de arnés ligera añade flujos de trabajo con estado y lo que el informe llama iniciación proactiva de servicios.

El informe comienza con una visión de los agentes GUI como "un ejecutor de propósito general sobre dispositivos digitales existentes". La lista adjunta a esa visión es específica: ejecutarse de forma fiable en dispositivos reales, ejecutar flujos de trabajo entre plataformas, combinar la interacción con GUI con la CLI, completar tareas de largo horizonte, poner en marcha servicios útiles de forma proactiva y mejorar con un esfuerzo humano mínimo. Interpreta el diseño como una lista de verificación frente a esa lista. El runtime de dispositivo real responde a la fiabilidad, los sandboxes de entorno cruzado responden al alcance, el espacio de acción unificado responde al requisito de GUI más CLI, el arnés responde al trabajo proactivo, y el bucle responde a la auto-mejora.

Gráfico : Puntuaciones del benchmark Qwen-UI-Agent
Puntuaciones del benchmark reportadas en el informe técnico de Qwen-UI-Agent, todas en porcentajes.

Un agente, cuatro entornos

La configuración de entrenamiento es tan notable como las puntuaciones. Un bucle de datos estilo AutoResearch hace que los agentes construyan tareas y entornos, diagnostiquen fallos y planifiquen iteraciones posteriores. El aprendizaje por refuerzo en línea entrena con trayectorias que superan los 100 turnos, con más de 10,000 entornos concurrentes que aceleran el despliegue. El trabajo de largo horizonte, mantener un objetivo a lo largo de cien o más turnos de modelo, es el régimen para el que está construida esa configuración.

Las puntuaciones

La tabla siguiente está tomada de la página del proyecto Qwen-UI-Agent. El móvil es donde el informe afirma resultados de última generación; el uso de computadora y navegador se describe como competitivo frente a modelos de vanguardia, citando a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol.

Resultados de benchmark reportados en el informe técnico de Qwen-UI-Agent
BenchmarkDominioPuntuación
MobileWorldMóvil82.1%
MobileWorld-RealMóvil, dispositivo real92.2%
AndroidDailyMóvil97.5%
OSWorld-VerifiedComputadora79.5%
OSWorld-v2Computadora40.0% progreso parcial
WebArenaNavegador73.6%
ScreenSpot-ProAnclaje de GUI81.5%

La línea de OSWorld merece una segunda mirada. En OSWorld-Verified el agente publica un 79.5%. En OSWorld-v2 el informe lista una puntuación de progreso parcial del 40.0%. Las dos pruebas difieren, y una brecha de ese tamaño es la diferencia entre un agente que resuelve tareas de escritorio y uno que llega solo hasta cierto punto. Si lees un solo número en este informe, lee ese. Es el límite honesto del sistema actual.

Qué observar

Las afirmaciones comparativas, de última generación en móvil, competitivas en escritorio, provienen de los autores. Nada de esto está verificado de forma independiente todavía, y el proyecto ha reunido 278 votos positivos en Hugging Face, un número modesto para un informe que afirma los mejores resultados. El bucle también plantea una pregunta obvia: cuando los agentes construyen las tareas y los entornos en los que se entrenan, ¿cuánto de la puntuación es capacidad y cuánto es un ciclo ajustado a lo que premian los benchmarks? La brecha sin explicar entre MobileWorld-Real y MobileWorld apunta en la misma dirección.

Nada de esto convierte el informe en una demo. Qwen-UI-Agent incorpora hardware real al bucle de entrenamiento, y el 97.5% en AndroidDaily es el tipo de cifra que los laboratorios rivales querrán verificar. La brecha de escritorio es lo que hay que observar. Ciérrala, y la afirmación de mundo real empieza a sostenerse también en escritorios, no solo en teléfonos.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.