SevenTnewS

Architecture IA

La course aux modèles a désormais une deuxième piste : l'orchestration l'emporte sur la taille brute

Le plafonnement par Anthropic des compétences cyber de Claude Opus 5, l'orchestration par Fugu de Sakana de nuées de modèles, et le nouveau routage multi-modèle de Claude Code pointent tous vers le même changement : le prochain avantage concurrentiel des systèmes d'IA est l'orchestration, et non la seule taille brute des modèles.

Emmanuel Fabrice Omgbwa Yasse

2026-07-28 · 3 min de lecture

La course aux modèles a désormais une deuxième piste : l'orchestration l'emporte sur la taille brute
Sources : Analysis synthe…

Anthropic a délibérément plafonné les capacités de cybersécurité de Claude Opus 5. Sakana AI a construit Fugu pour orchestrer un pool de modèles ouverts au lieu d'en entraîner un seul géant. Et Claude Code, l'outil de codage d'Anthropic, vient d'acquérir la capacité de router une tâche sur toute une série de modèles plutôt que de tout envoyer à un modèle phare unique. Aucun de ces produits n'est identique, et aucune des équipes derrière eux ne s'est coordonnée. Mais mis côte à côte, ils décrivent le même pari : les prochains gains dans les systèmes d'IA proviennent moins de l'agrandissement d'un modèle que de la décision, par tâche, du modèle ou de la partie de modèle à impliquer.

L'essaim rend le calcul explicite

La comparaison entre Claude Opus 5 et le Fugu de Sakana expose clairement le compromis. Opus 5 offre des performances quasi-phares pour environ la moitié du coût en tokens des alternatives de premier plan, une bonne affaire pour la plupart des charges de travail. Mais ses compétences en cybersécurité sont délibérément plafonnées, et sur les tâches nécessitant cette capacité, l'approche de Fugu, qui orchestre plusieurs petits modèles ouverts, rattrape ou dépasse les benchmarks de pointe en répartissant le travail entre spécialistes plutôt que de demander à un généraliste de tout faire. Lequel l'emporte dépend de la tâche, du budget et de la complexité d'orchestration qu'une équipe est prête à assumer. C'est un type de décision d'achat véritablement nouveau : non pas "quel est le modèle le plus intelligent ?", mais "quelle stratégie de routage correspond à ce travail ?".

La nouvelle intégration de Fugu dans Claude Code prend cette logique et la place dans un outil que des millions de développeurs utilisent déjà quotidiennement. Les développeurs peuvent désormais intégrer un pool de modèles spécialisés dans l'environnement de codage d'Anthropic, plutôt que d'être enfermés dans le Claude qui tourne cette semaine-là. Le détail qui mérite qu'on s'y attarde est de savoir qui a livré cette fonctionnalité : non pas une startup cherchant à se différencier, mais l'entreprise qui fabrique le modèle phare, construisant une porte par laquelle les modèles concurrents peuvent entrer dans son propre produit. C'est un signe de la direction que l'entreprise pense que le marché prend. Le routage de modèles a cessé d'être un bricolage que les développeurs construisaient pour eux-mêmes pour devenir une fonctionnalité de plateforme qu'un laboratoire de pointe livre par défaut.

La même logique, une couche plus bas

L'approche de CLSA pour l'attention sparse applique la même idée à l'intérieur d'un seul passage d'inférence de modèle : au lieu de calculer une nouvelle décision de routage à chaque couche, ce qui est gaspilleur et répétitif, il calcule un passage de routage par séquence et le réutilise, réduisant les frais généraux du cache KV tout en préservant la sélectivité au niveau des tokens. Le gain rapporté, jusqu'à 17.1x le débit pour un contexte de 128K, vient du constat qu'un recalcul complet à chaque couche résolvait un problème qu'une seule décision bien placée pouvait traiter tout aussi bien.

C'est le fil conducteur à travers les trois histoires. Que la question soit quel modèle gère une tâche entière, quel système spécialisé gère un scan de sécurité, ou quelles têtes d'attention sont calculées à une couche donnée, l'industrie converge vers la même réponse : ne pas tout faire passer par le même chemin coûteux par défaut. Décider une fois, router en conséquence, et ne payer le coût total que là où cela vous apporte réellement quelque chose. L'augmentation de la taille d'un modèle unique se produit encore, mais ce n'est plus le seul levier que l'on actionne, et de plus en plus, ce n'est même plus le premier.

Ce que cela signifie pour les acheteurs

La conclusion pratique pour quiconque déploie ces systèmes est que "quel modèle devrions-nous utiliser" devient la mauvaise question à poser isolément. La meilleure question est quel mélange, et si le surcoût d'orchestration en vaut la peine pour une charge de travail donnée. L'approche multi-agent de Fugu ajoute une réelle complexité, plus de pièces mobiles, plus d'endroits où un pipeline peut casser, plus de surface à surveiller. La simplicité d'Opus 5 est une caractéristique, pas une limitation, pour les équipes qui n'ont pas besoin du plafond spécialisé que Fugu peut atteindre. Il n'y a pas de gagnant universel ici, et c'est précisément le propos : les décisions de routage sont intrinsèquement locales à la tâche, ce qui est un monde très différent de celui où tout le monde attendait simplement la prochaine version phare.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.