SevenTnewS

Analyse des coûts

Les modèles d'IA internes de Microsoft réduisent les coûts GPU jusqu'à 89 % en production

Microsoft fait état d'une réduction de 84 % des coûts GPU pour la génération d'images et de 89 % pour la voix avec ses modèles MAI-2.5 et MAI-Voice-2-Flash désormais en production sur Bing, PowerPoint et Dynamics 365. La stratégie des modèles internes offre des avantages de coûts mesurables par rapport aux alternatives tierces.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-24 · 3 min de lecture

Les modèles d'IA internes de Microsoft réduisent les coûts GPU jusqu'à 89 % en production
Sources : Introducing MAI…

Microsoft a mis en production ses modèles MAI internes dans une large gamme de produits, et les premiers résultats sont mesurés en coûts, pas seulement en qualité. La société a publié mercredi des chiffres montrant que MAI-Image-2.5 a réduit les coûts GPU de 84 % dans les tâches image-à-image de PowerPoint par rapport à GPT-Image-2, tandis que MAI-Voice-2-Flash a réduit les coûts GPU jusqu'à 89 % dans Dynamics 365 Contact Center.

Ces chiffres sont importants car ils déplacent la conversation des positions dans les classements vers ce qui détermine réellement l'adoption en entreprise : le coût total de possession. Microsoft ne se contente pas de rivaliser sur la qualité d'image ou le réalisme vocal. Il rivalise sur le coût de l'inférence à grande échelle, et les chiffres suggèrent que l'entreprise a trouvé un écart important.

Preuve en production au-delà du marketing

L'approche de Microsoft se distingue de la tendance des publications open-weight comme Gemma 4 de Google ou Muse Spark de Meta. Plutôt que de proposer un modèle que les développeurs peuvent déployer n'importe où, Microsoft construit d'abord pour ses propres produits. Bing Image Creator est désormais entièrement alimenté par MAI-Image-2.5. L'édition d'images OneDrive l'utilise comme modèle par défaut, la société faisant état d'une augmentation de 26 % des taux de sauvegarde et d'une latence P95 inférieure de 25 % depuis le changement.

Les économies s'étendent à la voix. MAI-Voice-2-Flash, présenté lors de Build, est désormais le pivot de Dynamics 365 Contact Center, utilisé par des clients dont T-Mobile et EasyJet. Il offre deux fois la vitesse de MAI-Voice-2 avec un prix par caractère 32 % inférieur, et la réduction des coûts GPU en production a atteint 89 %.

MAI-Image-2.5-Pro est un grand pas en avant pour les outils GenMedia. Au-delà de la qualité d'image impressionnante, sa capacité à restituer du texte avec ce niveau de précision est une véritable avancée. Il comprend également les éditions en langage naturel, ce qui rend l'itération créative plus rapide et bien plus intuitive. Microsoft s'est fermement imposé parmi les leaders de l'IA générative.
, Rob Reilly, Global Chief Creative Officer, WPP

L'avantage en chiffres des coûts

Microsoft a publié des améliorations de performance spécifiques qui vont au-delà des affirmations typiques des benchmarks. Le tableau suivant résume les données de production publiées par la société :

ScénarioAmélioration par rapport au prédécesseurModèle
Tâches d'image PowerPoint84 % de réduction des coûts GPUMAI-Image-2.5
Voix Dynamics 36589 % de réduction des coûts GPUMAI-Voice-2-Flash
Édition d'images OneDrive2,5x d'efficacité, 25 % de latence P95 inférieureMAI-Image-2.5
Transcription Dragon Copilot (58 langues)50 % de réduction relative des erreursMAI-Transcribe-1.5

Le partenariat Dragon Copilot montre que la stratégie s'étend au-delà des produits grand public. L'outil de documentation médicale, utilisé par 170 000 professionnels et traitant 28 millions de rencontres patients au dernier trimestre, utilise désormais MAI-Transcribe-1.5. Les évaluations internes ont montré une réduction relative de 50 % des taux d'erreur de transcription et d'identification de la langue dans la plupart des langues.

Tarification et positionnement

MAI-Image-2.5-Pro est désormais en prévisualisation publique. Il coûte 5 $ pour 1 million de tokens d'entrée de texte, 8 $ pour 1 million de tokens d'entrée d'image et 106 $ pour 1 million de tokens de sortie d'image. MAI-Voice-2-Flash est proposé à 15 $ pour 1 million de caractères, soit 32 % moins cher que MAI-Voice-2. La société a déclaré que les modèles ont été entraînés sur des données propres, traçables et de qualité professionnelle, sans distillation à partir de modèles tiers.

Microsoft met les modèles à disposition via MAI Foundry et une intégration Azure Voice Live qui permet aux développeurs de créer des agents de parole à parole avec une faible latence.

Ce que cela signifie pour le marché

La décision de Microsoft met la pression sur les fournisseurs de modèles qui dépendent d'API tierces ou qui ne peuvent égaler l'intégration verticale de la construction pour leur propre infrastructure. Des entreprises comme OpenAI et Anthropic font face à un paysage où Microsoft peut à la fois construire des modèles compétitifs et les absorber dans ses produits sans friction de distribution.

Le cluster GB200 désormais opérationnel chez MAI suggère que l'investissement en calcul se poursuit. Pour les acheteurs en entreprise, le calcul change : les modèles propriétaires des fournisseurs de plateformes peuvent offrir non seulement de la commodité, mais aussi de réels avantages de coûts à grande échelle.

Rien de tout cela ne fait de Microsoft le leader incontesté dans une capacité unique. Ce que cela fait, c'est construire un fossé : chaque produit qui passe à un modèle MAI économise de l'argent, et ces économies se cumulent à mesure que le volume augmente. C'est le genre d'avantage qui est difficile à reproduire sans un écosystème de produits comparable.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.