Agents GUI
L'agent Qwen-UI-Agent d'Alibaba obtient de meilleurs scores sur de vrais téléphones que dans les sandboxes
Le Qwen-UI-Agent du laboratoire Tongyi d'Alibaba revendique des scores mobiles de pointe (97,5 % sur AndroidDaily) et des résultats compétitifs en usage informatique face à Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol. Son score sur benchmark sur appareil réel dépasse son score en sandbox, tandis que 40 % de progression partielle sur OSWorld-v2 constitue la limite honnête.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-31 · Dernière mise à jour : 2026-08-02 · 3 min de lecture

Le Qwen-UI-Agent obtient de meilleurs scores sur de vrais téléphones que sur le benchmark sandbox qui lui est adjacent. Un rapport technique du laboratoire Tongyi d'Alibaba, soumis le 30 juillet 2026, fait état de 92,2 % sur MobileWorld-Real, le test sur appareil réel, contre 82,1 % sur MobileWorld. Le document n'explique pas cet écart, et les deux tâches ne sont pas nécessairement d'égale difficulté. Quoi qu'il en soit, la direction prise constitue tout l'argument du projet : un agent GUI conçu pour des appareils qui existent réellement.
Le rapport présente Qwen-UI-Agent comme un « agent GUI fondamental centré sur le monde réel ». Il couvre le mobile, l'usage informatique, le web et l'environnement DeepSearch. Il ne s'agit pas d'un chatbot qui décrit ce qu'il ferait ; le modèle opère directement sur l'écran. Son espace d'action unifié entremêle les opérations GUI avec l'exécution en ligne de commande et génère des actions groupées en un seul tour de modèle, ce qui permet au modèle de planifier plusieurs étapes à la fois au lieu de faire des allers-retours à chaque appui. Une couche d'orchestration légère ajoute des flux de travail avec état et ce que l'article appelle l'initiation proactive de services.
L'article s'ouvre sur une vision des agents GUI comme « un exécuteur polyvalent sur les appareils numériques existants ». La liste associée à cette vision est précise : fonctionner de manière fiable sur de vrais appareils, exécuter des flux de travail multiplateformes, combiner l'interaction GUI avec la CLI, accomplir des tâches à long horizon, lancer des services utiles de manière proactive et s'améliorer avec un effort humain minimal. Lisez la conception comme une liste de contrôle face à cette liste. Le runtime sur appareil réel répond à la fiabilité, les sandboxes multi-environnements répondent à la portée, l'espace d'action unifié répond à l'exigence GUI plus CLI, le harness répond au travail proactif et le flywheel répond à l'auto-amélioration.

Un agent, quatre environnements
Le dispositif d'entraînement est aussi remarquable que les scores. Un flywheel de données de type AutoResearch fait construire aux agents des tâches et des environnements, diagnostiquer les échecs et planifier les itérations suivantes. L'apprentissage par renforcement en ligne s'entraîne sur des trajectoires dépassant les 100 tours, avec plus de 10 000 environnements simultanés pour accélérer le déploiement. Le travail à long horizon, qui consiste à maintenir un objectif sur cent tours de modèle ou plus, est le régime pour lequel ce dispositif est conçu.
Les scores
Le tableau ci-dessous est tiré de la page du projet Qwen-UI-Agent. C'est sur le mobile que le rapport revendique des résultats de pointe ; l'usage informatique et navigateur est décrit comme compétitif face aux modèles de pointe, nommément Opus 4.8, Gemini 3.1 Pro et GPT-5.6 Sol.
| Benchmark | Domaine | Score |
|---|---|---|
| MobileWorld | Mobile | 82,1 % |
| MobileWorld-Real | Mobile, appareil réel | 92,2 % |
| AndroidDaily | Mobile | 97,5 % |
| OSWorld-Verified | Ordinateur | 79,5 % |
| OSWorld-v2 | Ordinateur | 40,0 % de progression partielle |
| WebArena | Navigateur | 73,6 % |
| ScreenSpot-Pro | Ancrage GUI | 81,5 % |
La ligne OSWorld mérite un second regard. Sur OSWorld-Verified, l'agent affiche 79,5 %. Sur OSWorld-v2, le rapport indique un score de progression partielle de 40,0 %. Les deux tests diffèrent, et un écart de cette ampleur fait la différence entre un agent qui résout les tâches de bureau et un agent qui n'y arrive qu'en partie. Si vous ne devez retenir qu'un chiffre de ce rapport, retenez celui-ci. C'est la limite honnête du système actuel.
Ce qu'il faut surveiller
Les affirmations comparatives, de pointe sur mobile, compétitif sur bureau, émanent des auteurs. Rien n'est encore vérifié de manière indépendante, et le projet a recueilli 278 votes positifs sur Hugging Face, un nombre modeste pour un article revendiquant les meilleures notes. Le flywheel soulève également une question évidente : lorsque les agents construisent les tâches et les environnements sur lesquels ils s'entraînent, dans quelle mesure un score relève-t-il de la capacité et dans quelle mesure d'une boucle calibrée sur ce que les benchmarks récompensent ? L'écart inexpliqué entre MobileWorld-Real et MobileWorld va dans le même sens.
Rien de tout cela ne fait du rapport une simple démonstration. Qwen-UI-Agent intègre du matériel réel dans la boucle d'entraînement, et 97,5 % sur AndroidDaily est le genre de chiffre que les laboratoires concurrents voudront vérifier. L'écart sur le bureau est le point à surveiller. Comblez-le, et la revendication sur le monde réel commencera à tenir aussi bien sur les ordinateurs de bureau que sur les téléphones.
- Source : Alibaba's Qwen-UI-Agent scores higher on real phones than in sandboxes — 2026-07-30
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.