SevenTnewS

Stratégie IA

Les modèles d'IA internes de Microsoft réduisent les coûts de production de 89 %

Les modèles MAI maison de Microsoft sont en production, offrant des économies de coûts spectaculaires dans plusieurs produits. Ces chiffres signalent un changement stratégique : l'entreprise rivalise désormais sur l'efficacité d'inférence, pas seulement sur la qualité des modèles.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-29 · 2 min de lecture

Les modèles d'IA internes de Microsoft réduisent les coûts de production de 89 %
Sources : Microsoft AI Bl…

Microsoft réalise de réelles économies sur ses propres modèles d'IA. L'entreprise a publié cette semaine des chiffres de production pour MAI-Image-2.5-Pro et MAI-Voice-2-Flash qui recentrent la conversation sur l'IA, passant des droits de vantardise des benchmarks à ce qui intéresse réellement les acheteurs en entreprise : le coût opérationnel.

Les modèles MAI internes, d'abord présentés en aperçu lors de la conférence Build, sont désormais par défaut dans plusieurs produits Microsoft. Dans PowerPoint, MAI-Image-2.5 alimente l'édition image-à-image et réduit les coûts GPU de 84 % par rapport à GPT-Image-2, selon Microsoft, s'appuyant sur les mêmes gains d'efficacité observés dans le déploiement de MAI dans Excel par Microsoft. Dans OneDrive, le même modèle a réduit la latence P95 d'environ 25 % et augmenté les taux de sauvegarde des utilisateurs de 26 %, tout en offrant une efficacité 2,5 fois supérieure sous des charges de travail à utilisation moyenne, une tendance reflétée par la génération d'images compacte de Mage-Flow.

Les coûts vocaux chutent encore plus

MAI-Voice-2-Flash, conçu pour les expériences vocales à volume élevé, fonctionne deux fois plus vite que MAI-Voice-2 avec une tarification par caractère 32 % inférieure. Il alimente désormais Dynamics 365 Contact Center, servant des clients entreprises dont T-Mobile et EasyJet. Microsoft affirme que le modèle a réduit les coûts GPU de 89 % dans ce déploiement, s'alignant sur une tendance plus large de l'industrie vers une inférence moins chère que le pari de 800 millions de dollars de Together AI illustre. Le prix est fixé à 15 $ par million de caractères. Azure Voice Live intègre également MAI-Voice-2-Flash, offrant aux développeurs un chemin pour construire des agents vocaux avec une faible latence et une prosodie naturelle.

Des classements à l'économie de production

Ces chiffres proviennent du trafic réel, pas de benchmarks jouets. Microsoft ne prétend pas à une parité de qualité en théorie ; il prouve que ses modèles peuvent servir des charges de production à une fraction du coût GPU des alternatives, faisant écho aux conclusions de MAI-Cyber-1-Flash de Microsoft, qui offre les meilleurs scores de détection de vulnérabilités pour la moitié du coût GPU. Pour les entreprises qui décident d'acheter, le coût total de possession peut être aussi important que la qualité de la sortie.

Bing Image Creator est désormais alimenté à 100 % par MAI-Image-2.5 de bout en bout, a indiqué l'entreprise. MAI-Image-2.5-Pro, au prix de 5 $ par million de tokens d'entrée de texte et de 106 $ par million de tokens de sortie d'image, ajoute la prise en charge du rendu précis du texte dans les images et des demandes d'édition en langage naturel. Rob Reilly, directeur créatif mondial chez WPP, a qualifié la précision du rendu du texte de « véritable avancée ».

Partenariats spécialisés par domaine

Microsoft a également détaillé un partenariat avec Dragon Copilot, une solution de documentation médicale utilisée par 170 000 fournisseurs qui a traité 28 millions de rencontres avec des patients le trimestre dernier. MAI-Transcribe-1.5 prend désormais en charge 58 langues pour Dragon Copilot, remplaçant un modèle tiers précédent. Les évaluations internes montrent une réduction relative de 50 % des taux d'erreur de transcription et d'identification de la langue dans la plupart des langues, selon Microsoft. Des recherches préliminaires suggèrent des améliorations de la précision des notes médicales en aval.

Le déploiement du modèle est associé à des investissements dans l'infrastructure. Microsoft a indiqué que son cluster GB200 est désormais opérationnel, signalant une attention continue sur le calcul pour la formation de modèles de nouvelle génération, similaire à l'investissement de 360 millions d'euros de la France dans un cluster.

L'essentiel à retenir

Le jeu de Microsoft n'est pas celui de Google ou de Meta. Au lieu de publier des poids ouverts, l'entreprise construit d'abord pour ses propres produits, gardant la valeur en interne. Les chiffres des coûts de production montrent que la stratégie fonctionne. La leçon pour les concurrents : l'efficacité de l'inférence est l'endroit où la prochaine phase de la course à l'IA se décidera, et Microsoft a déjà une longueur d'avance.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.