Test de modèle
Qwen2.5-Omni : le modèle open-source qui tient enfin ce que ses concurrents promettent seulement
Analyse approfondie du modèle open-source qui traite simultanément texte, images, audio et vidéo tout en générant un flux de parole, surpassant GPT-4o-mini et Gemini sur plusieurs benchmarks, tout en tenant sur un seul GPU grand public avec quantification.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-03 · 4 min de lecture

L'équipe Qwen d'Alibaba a publié Qwen2.5-Omni, un modèle multimodal de 7 milliards de paramètres qui gère le texte, les images, l'audio et la vidéo en même temps, et peut générer un flux de parole en sortie. Dans les benchmarks, il bat ses rivaux open-source et propriétaires, tout en fonctionnant sur un seul GPU.
Le modèle utilise une architecture Thinker-Talker qui sépare la perception de la génération. Le Thinker gère l'encodage multimodal. Le Talker synthétise un flux de parole ou du texte. Un embedding de position personnalisé, TMRoPE, synchronise les horodatages vidéo avec l'audio, ce qui permet au modèle de comprendre les modalités en temps réel.
Ce qui distingue Qwen2.5-Omni de la concurrence, c'est l'ampleur de ses performances. Sur OmniBench, un benchmark mesurant la compréhension de la parole, des événements sonores et de la musique, la version 7B obtient 56,13 %, soit 13 points d'avance sur Gemini 1.5 Pro (42,91 %). Sur le raisonnement audio (MMAU), il atteint 65,6 % en global, battant Gemini-Pro-V1.5 (54,9 %) et Qwen2-Audio (49,2 %). La qualité de génération de la parole est également solide : sur l'ensemble test-hard de SEED, la variante optimisée par RL a un taux d'erreur de mots de 6,54 %, comparable à des modèles TTS spécialisés comme Seed-TTS_RL (6,42 %).
Plus frappante encore est la compréhension d'images du modèle. Bien qu'il s'agisse d'un modèle omni, Qwen2.5-Omni-7B égalise le modèle de vision dédié Qwen2.5-VL-7B sur MMMU (59,2 contre 58,6), le bat sur MMStar (64,0 contre 63,9) et fait match nul sur MathVision (25,0 contre 25,1). Sur le benchmark OCR DocVQA, il obtient 95,2 % contre 95,7 % pour Qwen2.5-VL-7B, un écart négligeable. GPT-4o-mini est en retard sur la plupart des benchmarks de vision : MMMU 60,0 contre 59,2, MathVista 52,5 contre 67,9, MMStar 54,8 contre 64,0.
La compréhension vidéo suit la même histoire. Sur Video-MME avec sous-titres, Qwen2.5-Omni-7B atteint 72,4 %, battant Qwen2.5-VL-7B (71,6 %) et GPT-4o-mini (64,8 %). Sur MVBench, il obtient 70,3 contre 69,6 pour son équivalent dédié à la vision.
Architecture et entraînement
L'architecture Thinker-Talker est plus qu'un nom astucieux. Le Thinker est un Transformer à décodeur seul utilisant Qwen2.5 comme colonne vertébrale, avec des encodeurs audio et vidéo ajoutés. Il utilise une attention causale sur toutes les modalités, le modèle traite les entrées de manière séquentielle et contextuelle, sans modules de fusion séparés. Le Talker, un décodeur léger, prend le dernier état caché du Thinker et génère soit des tokens de texte, soit des tokens de parole via un codec. Les deux modules partagent des paramètres via un entraînement entrelacé : le Thinker se met à jour à chaque étape, mais le Talker seulement pendant la génération de parole.
L'entraînement s'est déroulé en trois étapes : alignement des modalités avec 1,2 billion de tokens de données diverses, ajustement supervisé multitâche sur 1,3 million d'échantillons texte-image-vidéo et 170 000 heures d'audio, et apprentissage par renforcement à partir du feedback humain pour la qualité de la voix. Le résultat est un modèle qui peut écouter une question, regarder une vidéo, raisonner sur les deux et répondre en langage naturel, tout en un seul passage avant.
Déploiement pratique
Contrairement aux modèles omni de Google ou OpenAI qui nécessitent des API cloud, Qwen2.5-Omni fonctionne sur du matériel grand public. La version 7B nécessite 31 Go de mémoire GPU en BF16 avec FlashAttention-2, ce qui tient sur un RTX 4090. Les versions quantifiées (GPTQ-Int4, AWQ) réduisent la mémoire à moins de 12 Go, tenant sur un RTX 3080 ou 4080. Une variante 3B existe pour les appareils périphériques, avec support MNN pour les SoC mobiles : sur un Snapdragon 8 Elite, le Thinker décode à 11,52 tok/s et génère de la parole à 27,36 tok/s.
Le déploiement est simple. Le modèle est intégré dans les dernières versions de Hugging Face Transformers (v4.52.3) et vLLM. Des images Docker sont disponibles. Des extraits de code dans le dépôt montrent une inférence en moins de 20 lignes de Python.
Ce qui doit être amélioré
Les performances en texte uniquement sont en retard par rapport aux modèles de langage purs de taille similaire. Sur MMLU-Pro, Qwen2.5-Omni-7B obtient 47,0, contre 56,3 pour Qwen2.5-7B. Cet écart suggère que l'entraînement multimodal impose un compromis sur le raisonnement en langage uniquement. Le modèle nécessite également un prompt système spécifique pour générer de la parole, une contrainte fragile pour les développeurs qui souhaitent personnaliser le comportement. Et si les performances sur OmniBench sont impressionnantes, elles n'ont pas encore été reproduites de manière indépendante par des tiers.
La sortie vocale ne prend actuellement en charge que deux voix prédéfinies (Chelsie et Ethan), bien que le service API d'Alibaba Cloud en propose quatre. L'ajustement local pour des voix personnalisées n'est pas documenté.
Verdict
Qwen2.5-Omni est une réussite rare : un modèle open-source qui établit une nouvelle norme dans son domaine tout en fonctionnant sur du matériel que les développeurs possèdent déjà. Il ne se contente pas de rivaliser avec les concurrents propriétaires sur les tâches omni, il les bat sur la plupart des benchmarks. Le compromis sur le texte seul est réel mais acceptable pour un modèle conçu pour unifier les modalités. Pour quiconque construit des agents vocaux en temps réel, des pipelines de compréhension vidéo ou des assistants multimodaux, c'est le modèle open-source par lequel commencer.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.