Qwen / Alibaba Cloud
Qwen2.5-Omni surpasse Gemini-1.5-Pro sur OmniBench et tient en moins de 12 Go
Le Qwen2.5-Omni open source d'Alibaba a surclassé Gemini-1.5-Pro sur OmniBench et a pris la tête du classement MMAU de raisonnement audio. Les versions quantifiées réduisent la VRAM sous 12 Go et la prise en charge de MNN apporte le chat vocal en temps réel sur les téléphones.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-07 · 4 min de lecture

L'équipe Qwen d'Alibaba Cloud a publié Qwen2.5-Omni le 26 mars 2025, et les chiffres de son dépôt parlent d'eux-mêmes. Le modèle est multimodal de bout en bout : il accepte en entrée du texte, des images, de l'audio et de la vidéo, et répond avec du texte en streaming et de la parole naturelle. La version 7B a atteint le sommet de la liste des tendances de Hugging Face le 2 avril, une variante 3B a suivi le 30 avril, et l'équipe a publié un rapport technique (arXiv 2503.20215) en parallèle de la sortie.
Le résultat principal, c'est l'écart sur les benchmarks. Sur OmniBench, qui teste des tâches obligeant un modèle à utiliser plusieurs modalités à la fois, Qwen2.5-Omni-7B a obtenu une moyenne de 56.13% et la 3B a marqué 52.19%. Gemini-1.5-Pro a enregistré 42.91%. Ce sont les chiffres publiés par l'équipe elle-même, et c'est la raison pour laquelle cette sortie mérite plus qu'un simple survol.
Le raisonnement audio raconte une histoire similaire. Sur MMAU, la 7B a obtenu une moyenne de 65.60%, devant les 54.90% enregistrés par Gemini-Pro-V1.5 dans le même tableau. La mise à jour du 9 juin de l'équipe revendique la première place au classement MMAU et la première parmi les modèles open source sur MMAR. Trois jours plus tard, elle a annoncé la première place parmi les modèles open source sur MMSU, un benchmark de compréhension et de raisonnement du langage parlé.
| Benchmark (moyenne) | Qwen2.5-Omni-7B | Qwen2.5-Omni-3B | Gemini-1.5-Pro |
|---|---|---|---|
| OmniBench | 56.13% | 52.19% | 42.91% |
| MMAU (compréhension audio) | 65.60% | 63.30% | 54.90% |
Chiffres tels que publiés dans le dépôt Qwen2.5-Omni. Le tableau MMAU désigne le résultat de Gemini comme Gemini-Pro-V1.5 ; le tableau OmniBench utilise Gemini-1.5-Pro.
Les écarts se maintiennent aussi dans les tests à modalité unique. Sur LibriSpeech test-other, le taux d'erreur de mots de la 7B est de 3.4, légèrement meilleur que le 3.6 de Whisper-large-v3. Sur Common Voice 15, elle bat Whisper-large-v3 sur les quatre sous-ensembles linguistiques répertoriés, avec notamment un écart de 5.2 contre 12.8 sur le chinois.
Thinker-Talker et la parole en temps réel
L'architecture est la partie que la plupart des sorties cachent derrière une API. Qwen2.5-Omni se divise en un Thinker, qui raisonne sur le texte, les images, l'audio et la vidéo, et un Talker, qui génère la parole. Un embedding de position appelé TMRoPE aligne les horodatages vidéo avec l'audio, de sorte que le modèle peut entendre ce qui se passe à l'écran tout en regardant. Le chat vocal et vidéo en temps réel a été mis en ligne sur Qwen Chat le jour même de la sortie.
La sortie vocale s'approche des systèmes TTS dédiés. Sur l'ensemble difficile du benchmark SEED, la 7B affinée par RL enregistre un taux d'erreur de mots de 6.54 pour la cohérence du contenu, contre 1.94 pour Seed-TTS_RL et 6.83 pour CosyVoice 2. La similarité du locuteur atteint 0.752, juste en dessous des 0.782 de Seed-TTS_RL. Pour un modèle qui lit, regarde et raisonne, c'est une performance respectable.
La version 11.64 Go pour GPU grand public
La sortie qui compte pour ceux qui n'ont pas de cluster de GPU est arrivée le 16 mai. L'équipe a livré des versions 4 bits GPTQ-Int4 et AWQ de la 7B. Une entrée vidéo de 15 secondes qui nécessite 31.11 Go de VRAM en BF16 tombe à 11.64 Go avec GPTQ-Int4 et à 11.77 Go avec AWQ. Le README cite les RTX 3080, 4080 et 5070 comme cibles. Quelques jours plus tôt, la prise en charge de MNN avait mis le modèle sur les téléphones, avec la 7B atteignant un pic de 5.8 Go de mémoire sur Snapdragon 8 Gen 1 et 8 Elite, et la 3B à 3.6 Go. La 3B plus légère, publiée le 30 avril, existe pour permettre à davantage de plateformes de faire tourner le modèle tout court.
Les compromis sont visibles dans les mêmes tableaux. La quantification coûte un peu de précision et un peu de vitesse : MMLU-Pro passe de 47.0 à 43.76 sur la version GPTQ, tandis que VideoMME se maintient à 72.0 sur AWQ contre 72.4 en natif. L'équipe précise que les chiffres de VRAM sont des minimums théoriques, et que l'utilisation réelle est environ 1.2 fois plus élevée. Le chiffre de 11.64 Go ne couvre également que 15 secondes de vidéo. À 60 secondes, il grimpe à 29.51 Go. L'histoire du « moins de 12 Go » a une capacité d'attention limitée.
Là où les chiffres autodéclarés vacillent
Le déploiement a ses pièges. vLLM serve, la voie de service standard compatible OpenAI, ne prend en charge que le Thinker, ce qui signifie une sortie texte uniquement ; la génération audio nécessite le script end2end. Le modèle d'API DashScope qwen-omni-turbo est exclusivement en streaming. Et la sortie audio dépend d'une invite système spécifique, "You are Qwen, a virtual human...", faute de quoi aucune parole ne sera générée.
Tous les chiffres ci-dessus proviennent de l'équipe qui a construit le modèle. La vérification indépendante des modèles omni est plus mince que pour les LLM purement textuels, car les configurations d'évaluation sont plus récentes. Ce qui tient à l'examen, c'est la tendance : une 7B open source a surclassé un modèle fermé phare sur des tâches multimodales intégrées, et une version 4 bits met l'interaction vocale en temps réel à la portée d'un GPU de 12 Go. La question de savoir si des tests indépendants confirmeront les écarts est celle à laquelle la prochaine série de benchmarks devrait répondre.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.