SevenTnewS

Multimodal / Open Source

Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo

L'équipe Qwen d'Alibaba a publié Qwen-MM-Plugins, une boîte à outils Apache-2.0 qui donne aux agents de codage des skills multimodaux natifs : lecture d'images et de vidéos en résolution dynamique, OCR, grounding, ASR, mémoire vidéo longue, génération vidéo et contrôle en client léger de Blender et FreeCAD. Un seul script l'installe sur Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-15 · 4 min de lecture

Le pack de plugins Qwen donne à votre agent de codage des yeux, des mains et une mémoire vidéo
Sources : Qwen-MM-Plugins…·Authorized grou…

Qwen a publié un pack de plugins qui transforme les agents de codage en agents multimodaux. Qwen-MM-Plugins, publié sur GitHub sous l'organisation QwenLM, ajoute des skills pour la vision, l'audio et la 3D aux agents qui s'exécutent dans Claude Code, Codex, Qoder, OpenClaw, Qwen Code et Gemini CLI. La boîte à outils est open source sous licence Apache-2.0, avec la promesse centrale clairement énoncée dans le dépôt : rendre n'importe quel harnais d'agent natif multimodal.

Chaque capacité s'installe comme un skill, afin que le modèle sache que l'ensemble d'outils existe, plus un serveur MCP facultatif qui fournit les outils eux-mêmes, lancé à la demande par uvx. La première capacité s'appelle core. Elle gère la vision fondamentale, c'est-à-dire la lecture en résolution dynamique d'images, de vidéos, de documents et de modèles 3D, ainsi que l'OCR, le grounding, la segmentation, l'ASR, le chat visuel et la recherche web. Les autres packs sont video-memory, omni-av, video-edit, blender, freecad et edu-agent.

Ce que contient le nouveau dépôt Qwen

Les sept packs de capacités s'installent séparément, et le dépôt documente les fonctionnalités apportées par chacun. La répartition est la suivante.

CapacitéCe qu'elle fait
coreLecture en résolution dynamique d'images, de vidéos, de documents et de modèles 3D ; OCR, grounding, segmentation, ASR, chat visuel, recherche web
video-memoryMémoire graphique hiérarchique pour le question-réponse sur de très longues vidéos
omni-avCompréhension audio/vidéo omni-native : ASR avec horodatage et étiquettes de locuteurs, sous-titrage et grounding temporels, comptage d'événements, étiquetage musical
video-editWorkflows d'édition vidéo plus génération d'images, de vidéos et d'audio
blenderPilote une instance Blender en cours d'exécution via un client léger avec 22 outils : modélisation, matériaux, éclairage, rendu
freecadCAO paramétrique dans une instance FreeCAD en cours d'exécution via un client léger avec 14 outils ; modélisation, modifications de propriétés, import/export STEP/STL, analyse FEM
edu-agentTransforme un problème de maths ou de sciences en vidéo explicative chinoise étape par étape. Skill uniquement, pas de serveur MCP

Le dépôt fournit des cookbooks montrant chaque capacité en action, avec la liste des outils, la configuration et des cas pratiques. Le nombre d'outils Blender et FreeCAD donne une bonne idée de la granularité de l'intégration : 22 outils pour la modélisation, les matériaux, l'éclairage et le rendu dans Blender, 14 pour la modélisation paramétrique et l'analyse FEM dans FreeCAD.

Installez une fois, utilisez sur Claude Code, Codex et le reste

Qwen recommande un installateur guidé, un script unique qui gère l'installation, la configuration, la vérification et la désinstallation sur tous les harnais pris en charge. Il pilote l'installation native de chaque harnais en interne et écrit un fichier de configuration partagé dans ~/.qwen-mm-plugins/config, de sorte que les harnais en terminal et en interface graphique lisent la même configuration. La commande en une ligne récupère le script depuis install.sh dans le dépôt.

L'installation manuelle fonctionne aussi. Les harnais dotés de marketplaces de plugins, que le dépôt liste comme Claude Code, Qoder, Codex, OpenClaw et Qwen Code, peuvent intégrer une capacité en ajoutant le dépôt GitHub comme marketplace et en installant un pack nommé. Les autres harnais, notamment Gemini CLI, opencode, pi et QwenPaw, enregistrent le skill et le serveur MCP dans leur propre configuration. Le dépôt note que le plus simple est de demander directement à l'agent d'installer la capacité. Les utilisateurs Windows disposent d'une seule voie prise en charge, WSL2 ; le Windows natif n'a pas encore été validé.

Ce qu'il faut pour l'exécuter

La gestion des dépendances est volontairement légère. uvx installe les dépendances Python du profil choisi au premier lancement, donc pas de pip manuel. Les seules choses à installer soi-même sont les outils système : ffmpeg pour la vidéo et l'audio, plus éventuellement libreoffice, blender, texlive ou chromium pour la visualisation. Une commande bash install.sh verify auto-teste la configuration, confirme la clé API et signale les outils système manquants.

La lecture native ne nécessite pas de clé API. Les outils basés sur des API en nécessitent une : DASHSCOPE_API_KEY couvre le chat visuel, l'OCR, le grounding, la transcription, la compréhension audio-vidéo omni, la génération et la construction de video-memory ; SERPER_API_KEY couvre la recherche web, l'extracteur web et la recherche d'images. L'étape de configuration de l'installateur guidé les écrit dans le fichier de configuration partagé, qui est lu chaque fois qu'une variable n'est pas déjà présente dans l'environnement.

En pratique, la lecture est en résolution dynamique : chaque image, chaque frame vidéo et chaque page de document est automatiquement redimensionnée selon la grille de patches du modèle VL. Les exemples du dépôt incluent la lecture de tous les chiffres d'une capture d'écran de tableau de bord en 4K, l'OCR d'un reçu et le total des articles, le dessin de boîtes autour de chaque voiture dans une scène de rue, la demande des points principaux d'une conférence de deux heures avec horodatage, le comptage des passes réussies dans un clip sportif, et la modélisation d'un boulon hexagonal M6 et son export au format STEP.

Alibaba Cloud parie clairement que les workflows multimodaux ont leur place au-delà du seul écosystème Qwen. Cette décision correspond également à la direction prise dans ses travaux Qwen Studio sur le chatbot, la compréhension d'images et de vidéos, le traitement de documents et l'intégration de la recherche web, ainsi que dans Qwen2.5-Omni, la famille de modèles multimodaux de bout en bout qui traite texte, images, audio et vidéo en flux. Avec Qwen-MM-Plugins, les mêmes capacités s'appuient désormais sur les harnais d'agents d'autres fournisseurs. La licence est Apache-2.0, avec du code tiers sous licence MIT intégré pour les capacités Blender et FreeCAD, et des fichiers NOTICE spécifiques inclus pour l'attribution.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.