SevenTnewS

Stratégie de plateforme

Groq a arrêté de vendre de la vitesse et a commencé à vendre un système d'exploitation pour agents

Le lancement par Groq le 23 septembre du support MCP à distance, associé à des ajouts rapides de modèles comme Kimi K2-0905 et la série GPT-OSS d'OpenAI, transforme son API d'un pipeline d'inférence rapide en une couche d'orchestration agentique complète. La plateforme n'est plus en concurrence uniquement sur les tokens par seconde.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-19 · 4 min de lecture

Groq a arrêté de vendre de la vitesse et a commencé à vendre un système d'exploitation pour agents
Sources : Groq Changelog

Le journal des modifications raconte l'histoire mieux que n'importe quel communiqué de presse. Entre le 4 et le 23 septembre 2025, Groq a ajouté trois capacités majeures : une intégration bêta d'un serveur de protocole de contexte de modèle (MCP) à distance, le modèle instruct Kimi K2-0905 de Moonshot AI, et les systèmes agentiques Compound qui regroupent la recherche web, l'exécution de code et l'automatisation de navigateur en un seul appel API. Rien que par le volume, cela ressemble à une offensive produit. En y regardant de plus près, le schéma est cohérent : Groq ne vend plus d'inférence. Il vend un système d'exploitation agentique complet pour l'ère des API.Les agents parallèles ne sont pas une question de…

Le lancement MCP est le plus important des trois. MCP à distance, abréviation de Model Context Protocol, le standard ouvert d'Anthropic pour connecter les modèles d'IA à des outils externes, permet aux développeurs d'attacher n'importe quel serveur compatible MCP aux modèles hébergés par Groq. L'intégration est entièrement compatible avec l'API Responses d'OpenAI et sa propre spécification MCP à distance. L'effet pratique est que tout développeur utilisant actuellement l'infrastructure d'appel d'outils d'OpenAI peut migrer vers Groq sans toucher une seule ligne de code de connecteur. Ils changent le point de terminaison, conservent les définitions d'outils et paient moins par token. En annonçant la fonctionnalité, Groq a mis en avant sept partenaires de lancement : BrowserBase, Browser Use, Exa, Firecrawl, HuggingFace, Parallel, Stripe et Tavily, chacun fournissant un serveur MCP prêt à l'emploi pour l'automatisation web, la recherche, le scraping ou les workflows de paiement.Anthropic Academy : une plateforme gratuite pour en…

Si MCP est l'adaptateur universel, la sortie de Kimi K2-0905 offre aux développeurs un modèle conçu pour l'exploiter. Le dernier variant de Moonshot AI arrive sur GroqCloud avec un support dès le premier jour, une fenêtre de contexte de 256K, la plus grande de la plateforme à ce jour, et une mise en cache des invites qui réduit les coûts jusqu'à 50% sur les préfixes mis en cache. Les performances du modèle sont compétitives : plus de 200 tokens par seconde à un prix mixte de 1,50 $ par million de tokens. Plus important encore, Groq le positionne comme un modèle de codage agentique, affirmant une fiabilité améliorée sur les interactions complexes à plusieurs tours. Cela s'intègre parfaitement à l'histoire MCP : un modèle capable de gérer plusieurs appels d'outils sur une longue fenêtre de contexte est exactement le type de moteur qui rend le MCP à distance utile.Kimi K2.7 Code est plus rapide et moins cher. Mais le…

Les systèmes Compound et Compound Mini, promus de la version bêta à la disponibilité générale le 4 septembre, abstraient entièrement l'orchestration des outils. Construits sur les modèles GPT-OSS-120B d'OpenAI et Llama de Meta, ils intègrent la recherche web, l'exécution de code, Wolfram Alpha et l'automatisation parallèle de navigateur, jusqu'à dix navigateurs simultanés, en un seul appel API. Groq revendique une précision environ 25% supérieure et 50% d'erreurs en moins par rapport à Web Search Preview d'OpenAI et Perplexity Sonar sur des benchmarks internes. Compound n'est pas un modèle ; c'est un agent clé en main. Les développeurs qui ne souhaitent pas assembler leur propre chaîne d'outils avec MCP peuvent simplement appeler groq/compound et obtenir un assistant de recherche qui recherche, calcule et navigue sur les pages automatiquement.Le harnais open-source CUGA d'IBM évite la plomberie et…

La liste des modèles continue de s'étoffer. Les modèles à poids ouverts GPT-OSS-20B et GPT-OSS-120B d'OpenAI, publiés début août, apportent des capacités de raisonnement, une recherche intégrée dans le navigateur et des sorties structurées. Qwen 3 32B, ajouté en juin, prend en charge un mode de réflexion qui peut être désactivé pour des réponses à faible latence. Les modèles Llama 4 Scout et Maverick de Meta sont arrivés en avril avec une compréhension visuelle. Groq est délibérément agnostique en matière de modèles. L'objectif n'est pas de miser sur un seul modèle de fondation, mais d'héberger tous les modèles et de fournir le liant qui les rend utiles.

La mise en cache des invites, déployée fin août, automatise l'optimisation des coûts. Le système réutilise les calculs de requêtes récentes partageant un préfixe commun, les invites système, les définitions d'outils, les exemples few-shot, et applique une remise de 50% sur les tokens mis en cache. Les données mises en cache résident dans la mémoire volatile et expirent en quelques heures, ce qui contourne les problèmes de confidentialité qui affectent les caches persistants. La fonctionnalité fonctionne actuellement avec Kimi K2, d'autres modèles étant promis prochainement.

Le tableau stratégique devient plus clair à chaque entrée dans le journal des modifications. Le marché de l'inférence en tant que service est devenu une course aux commodités où les fournisseurs rivalisent sur le prix par token et la liste des modèles. Groq tente de quitter cette course en devenant la couche d'orchestration. Le MCP à distance offre aux développeurs un moyen standardisé d'attacher des outils. Compound leur offre un agent pré-assemblé. Kimi K2 et GPT-OSS leur offrent des modèles avec suffisamment de contexte et de support d'outils pour utiliser ces capacités à grande échelle. Les prix restent compétitifs, 1,50 $ par million de tokens pour Kimi K2, 0,29 $/0,59 $ pour Qwen 3, mais la différenciation ne porte plus sur l'économie unitaire d'un seul appel d'inférence. Il s'agit du coût total de la construction d'une application agentique, du début à la fin.

Il y a des risques. Le MCP est encore un standard bêta, et la feuille de route d'Anthropic pour le protocole pourrait évoluer d'une manière qui complique l'intégration de Groq. Les chiffres de performance de Compound proviennent des propres benchmarks de Groq, et non d'audits indépendants, et la fiabilité agentique dans le monde réel a tendance à se dégrader dans les cas limites que les évaluations contrôlées ne capturent pas. Le rythme rapide des ajouts de modèles soulève également la question de la maintenance. Chaque nouveau modèle nécessite des tests de compatibilité continus avec les intégrations d'outils, ce qui ne se scale pas linéairement.600 fichiers, une commande : ce que le refactoring de…

Néanmoins, la direction est claire. Groq construit pour un monde où l'application n'est pas une interface de chat mais un réseau d'appels d'outils orchestré par un modèle de raisonnement. Le journal des modifications des cinq derniers mois documente l'infrastructure de ce monde : MCP à distance pour le connecter, Compound pour l'empaqueter, Kimi K2 pour l'exécuter, la mise en cache des invites pour payer moins cher. Les tokens par seconde comptent toujours, mais ils ne sont plus le titre. Le titre est que Groq veut être la plateforme où les agents sont assemblés, pas seulement là où l'inférence a lieu.Aleph Alpha construit un modèle d'inférence théorique…

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.