SevenTnewS

Optimisation des coûts

Microsoft teste un modèle chinois pour réduire les coûts de Copilot jusqu'à 600 millions de dollars

Microsoft se prépare à tester le Kimi K3 de Moonshot AI au sein de Copilot dans le but de réduire les coûts d'inférence IA jusqu'à 600 millions de dollars. L'entreprise cherche des alternatives moins chères aux modèles d'OpenAI et d'Anthropic, mais le modèle chinois à poids ouverts doit encore passer des contrôles de qualité et de latence.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-21 · 2 min de lecture

Microsoft teste un modèle chinois pour réduire les coûts de Copilot jusqu'à 600 millions de dollars
Sources : Crypto Briefing…

Microsoft se prépare à exécuter le modèle Kimi K3 de Moonshot AI au sein de Copilot, une décision qui pourrait réduire sa facture d'inférence IA de jusqu'à 600 millions de dollars, selon un rapport de The Information.

Les ingénieurs travaillant sur Copilot prévoient d'évaluer si le modèle à poids ouverts de 2,8 billions de paramètres peut alimenter des fonctionnalités qui reposent actuellement sur des systèmes d'OpenAI et d'Anthropic. Les tests ne sont pas une conclusion acquise : les ingénieurs de Microsoft doivent d'abord déterminer si Kimi K3 répond aux exigences du produit en matière de qualité de réponse, de fiabilité, de sécurité et de latence.

Schéma : Microsoft's cost-cutting evaluation for Copilot
La voie de décision de Microsoft pour potentiellement remplacer les fournisseurs d'IA existants par le modèle Kimi K3 de Moonshot afin de réduire les coûts d'inférence de Copilot, selon The Information.

L'estimation de 600 millions de dollars, que Microsoft n'a pas confirmée publiquement, témoigne du coût pur de l'exécution de l'inférence à l'échelle de Copilot. L'inférence est le calcul utilisé chaque fois qu'un modèle reçoit une invite et génère une réponse. Pour un service servant des millions d'utilisateurs et traitant de grands volumes de jetons, ces coûts s'accumulent rapidement.

Microsoft a déjà testé les modèles DeepSeek et les versions antérieures de Kimi pour Copilot, selon une personne familière avec ses plans citée par le rapport. Ces évaluations suggèrent que l'entreprise est sérieuse dans le mélange et l'appariement des modèles plutôt que de confier chaque charge de travail à un seul fournisseur.

Kimi K3, publié le 16 juillet, est le modèle phare de Moonshot. La startup le décrit comme nativement multimodal avec une fenêtre de contexte d'un million de jetons, conçu pour le codage, le travail de connaissances et le raisonnement complexe. Sur certains benchmarks, il mène le peloton, SWE Marathon, BrowseComp, Terminal-Bench 2.1, mais suit les modèles propriétaires de pointe sur la plupart des évaluations larges. Sa structure à poids ouverts donnerait à Microsoft plus de contrôle sur la façon dont le modèle est hébergé et optimisé sur Azure.

Microsoft a promu cette approche agnostique en matière de modèle via Foundry, sa plateforme qui encourage les développeurs à choisir des modèles en fonction de la capacité, de la sécurité, de la latence et du coût plutôt que de par défaut l'option la plus puissante. La page de tarification de la plateforme répertorie déjà les modèles Moonshot antérieurs, notamment Kimi K2 Thinking, K2.5 Thinking et K2.6 Thinking. Kimi K3 n'y est pas encore apparu, ce qui correspond au rapport selon lequel l'intégration Azure est toujours en cours.

Si les tests réussissent, cela signifierait qu'un modèle chinois à poids ouverts fonctionne au sein de l'un des produits d'IA phares de Microsoft, approfondissant les liens de l'entreprise avec Moonshot et ajoutant plus de pression tarifaire sur les laboratoires américains qui alimentent actuellement Copilot. Avec 600 millions de dollars d'économies potentielles, la pression est clairement là.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.