SevenTnewS

coût d'inférence

4 published articles

IA3 min read

Raisonnement ouvert

Nemotron-4 de Nvidia est rapide, ouvert, et vise directement l’écart entre Llama et GPT

La gamme Nemotron-4 de Nvidia défie Llama 3.3 et Mistral Large avec des scores MMLU compétitifs et une économie d’inférence annoncée de 30 %. La licence ouverte et la stratégie en deux tailles en font une alternative pratique pour les équipes exécutant des charges de travail agentiques à grande échelle.

2026-07-25

IAFeatured2 min read

Optimisation des coûts

Microsoft teste un modèle chinois pour réduire les coûts de Copilot jusqu'à 600 millions de dollars

Microsoft se prépare à tester le Kimi K3 de Moonshot AI au sein de Copilot dans le but de réduire les coûts d'inférence IA jusqu'à 600 millions de dollars. L'entreprise cherche des alternatives moins chères aux modèles d'OpenAI et d'Anthropic, mais le modèle chinois à poids ouverts doit encore passer des contrôles de qualité et de latence.

2026-07-21

IAFeatured5 min read

Infrastructure IA

Le nouveau Nemotron 3 Ultra de Nvidia bouleverse l'équation des coûts des workflows agentiques

Nemotron 3 Ultra, le modèle dense-creux agentique de Nvidia, promet de réduire les coûts d'inférence jusqu'à 30 % par rapport aux modèles ouverts équivalents tout en conservant un raisonnement de pointe. Avec une fenêtre de contexte d'un million de jetons et une quantification NVFP4 native, il est positionné comme le cheval de bataille pour les charges de travail d'appel d'outils en entreprise.

2026-06-04

IAFeatured2 min read

Qwen3.7

La faille de fuseau horaire qui réduit les coûts d'inférence IA de 80%

Model Studio réduit automatiquement les coûts des API Qwen3.7-Max et Qwen3.7-Plus jusqu'à 80% pendant une fenêtre nocturne qui coïncide avec les heures de travail aux États-Unis et en Europe. Pas d'inscription, pas de changement de code, juste une inférence moins chère pour ceux qui synchronisent leurs appels.

2026-05-20