SevenTnewS

Intelligence Artificielle

Le modèle 7B qui surpasse les plus grands, tourne sur un téléphone et change l'équation des coûts de l'IA

Le Qwen2.5-Omni d'Alibaba Cloud est un modèle 7B qui gère le texte, les images, l'audio et la vidéo, générant de la parole et du texte en temps réel. Son architecture Thinker-Talker et l'encodage positionnel TMRoPE permettent une interaction en streaming, et la variante 3B fonctionne sur des SoC mobiles comme le Snapdragon 8 Gen 1 à des vitesses utilisables.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-23 · Dernière mise à jour : 2026-07-30 · 2 min de lecture

Le modèle 7B qui surpasse les plus grands, tourne sur un téléphone et change l'équation des coûts de l'IA
Sources : QwenLM/Qwen2.5-…·Alibaba Cloud A…

La plupart des modèles multimodaux empilent des encodeurs séparés pour chaque modalité et s'en contentent. Qwen2.5-Omni fait différemment. Il traite le texte, les images, l'audio et la vidéo comme des citoyens de première classe au sein d'une seule architecture de bout en bout et génère à la fois du texte et de la parole naturelle de manière continue. Le modèle, publié par l'équipe Qwen d'Alibaba Cloud fin mars 2025, a depuis été deux fois en tête de la page des tendances Hugging Face et a fait son chemin dans les environnements d'exécution mobiles via MNN. Cela s'inscrit dans une démarche plus large d'Alibaba visant à déployer l'IA au-delà du laboratoire, comme le montre leur pari d'infrastructure de 53 milliards de dollars.

Deux choix architecturaux distinguent Qwen2.5-Omni. Premièrement, la séparation Thinker-Talker : un module Thinker gère la perception et le raisonnement multimodaux, tandis qu'un module Talker gère la génération de la parole. Cela permet au modèle de décoder le texte et l'audio en parallèle plutôt qu'en séquence, ce qui explique pourquoi il peut diffuser une réponse parlée tout en finissant sa phrase. Deuxièmement, TMRoPE (Time-aligned Multimodal RoPE) aligne les encodages positionnels des images vidéo avec leurs horodatages audio correspondants, de sorte que le modèle comprenne qu'un événement visuel et un son appartiennent au même moment. Le problème de la synchronisation des signaux multimodaux est un défi connu que d'autres architectures abordent également, comme exploré dans une IA qui corrige ses propres sorties inter-modales.

Graphique : Comparaison de précision OmniBench
Qwen2.5-Omni-7B surpasse Gemini 1.5 Pro et MiniCPM-o sur OmniBench, comme rapporté dans l'article.

La version 7B offre des scores compétitifs ou meilleurs sur la plupart des benchmarks par rapport à des modèles de taille similaire. Sur OmniBench, qui teste le raisonnement parole-texte à travers les sons, la musique et la parole, Qwen2.5-Omni-7B a atteint 56,13 % de précision, bien devant les 42,91 % de Gemini 1.5 Pro et les 40,50 % de MiniCPM-o. Sur MMAU, un benchmark de compréhension et de raisonnement audio, il a obtenu 65,60 % au total, battant Qwen2-Audio de plus de 16 points. Sur la compréhension vidéo sans sous-titres (Video-MME), il a atteint 64,3 %, proche de Qwen2.5-VL-7B et GPT-4o-mini. La variante 3B, publiée un mois plus tard, reste compétitive : 52,19 % sur OmniBench et 63,30 % sur MMAU. Ces benchmarks mettent en évidence une tendance plus large des petits modèles à défier les plus grands, un motif visible dans le modèle Laguna XS qui a battu des modèles 137B.

Les chiffres qui comptent pour le déploiement se situent du côté des ressources. Le modèle 3B nécessite environ 3,6 Go de mémoire maximale sur un SoC mobile et exécute le décodage Thinker à 15,84 tok/s sur un Snapdragon 8 Gen 1, ou 23,31 tok/s sur un 8 Elite. Les modules Talker et Code2Wav ajoutent de la latence, mais le débit total de bout en bout reste dans la plage de 8 à 20 tok/s pour le décodage, selon le matériel. Cela place un assistant multimodal en temps réel dans le budget thermique d'un téléphone, et pas seulement dans une démonstration. La capacité d'exécuter de tels modèles sur l'appareil a des implications pour les agents autonomes qui ont besoin de réponses à faible latence, comme discuté dans les architectures d'agents parallèles.

La variante 7B en BF16 nécessite environ 31 Go pour une entrée vidéo de 15 secondes, ce qui exclut le mobile mais tient confortablement sur un seul A100 ou RTX 6000 Ada. Les versions quantifiées sur 4 bits (GPTQ-Int4, AWQ) réduisent la mémoire de plus de 50 % avec de petites pertes de précision : 3,71 WER sur LibriSpeech test-other contre 3,4 pour le modèle complet, 43,76 sur MMLU-Pro contre 47,0. Ce sont des variations généralement acceptables pour une utilisation en production.

L'histoire du déploiement mobile est la partie à surveiller. L'intégration MNN signifie que Qwen2.5-Omni exécute l'inférence sur l'appareil avec Snapdragon 8 Gen 1, 8 Elite, et probablement d'autres maintenant. L'empreinte mémoire, 5,8 Go de pointe pour le 7B sur téléphone, 3,6 Go pour le 3B, est élevée mais pas prohibitive pour les appareils phares. Les modèles basés sur le Neural Engine d'Apple et les puces Tensor de Google auront leurs propres réponses, mais le fait qu'un modèle omni 7B à poids ouverts tienne dans la RAM d'un téléphone n'est pas quelque chose que quelqu'un aurait parié il y a deux ans. Ce changement dans les capacités sur appareil est en train de remodeler la façon dont les agents IA sont déployés, un sujet couvert dans l'hypothèse des 314 milliards de dollars qui vient de s'effondrer.

Le document est honnête sur les limites. L'architecture Thinker-Talker ne peut pas gérer un réglage d'invite non contraint pour la sortie audio, l'invite système doit être définie sur une chaîne d'identité spécifique pour que la génération de parole fonctionne. Le module Talker ajoute environ 2 Go de mémoire GPU, et le désactiver économise cela au prix d'une sortie textuelle uniquement. La prise en charge des URL vidéo dépend du backend (torchvision >= 0.19.0 gère HTTP et HTTPS ; decord gère HTTP uniquement). Et le service vLLM, en mai 2025, ne prend en charge que le Thinker, la sortie audio nécessite un fork personnalisé de vLLM. Ce sont des lacunes d'ingénierie solubles, pas des défauts fondamentaux.

Ce que montre Qwen2.5-Omni, c'est que les modèles omni-modaux ne sont plus de simples curiosités de recherche. Un modèle qui bat des reconnaisseurs vocaux dédiés, des raisonneurs d'images et des benchmarks vidéo, et qui fonctionne sur un téléphone, change l'équation des coûts pour les assistants vocaux en temps réel, les outils d'accessibilité et l'analyse vidéo en direct. La prochaine question est de savoir si Alibaba Cloud le transformera en produit assez rapidement pour compter, ou laissera cela à quiconque construira d'abord sur les poids ouverts. La stratégie plus large de l'entreprise suggère qu'elle pense déjà au-delà des modèles, comme le montre son approche axée sur la plateforme.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.