SevenTnewS

IA frontière

Le Claude le plus intelligent d'Anthropic est celui que vous ne pouvez pas utiliser

Anthropic a lancé Claude Fable 5 pour tous et réservé Claude Mythos 5 à des partenaires vérifiés. Même classe de modèles, deux portes d'accès. Les benchmarks comptent moins que le routage, et le routage est la manière dont l'IA frontière se déploie désormais.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-03 · 5 min de lecture

Le Claude le plus intelligent d'Anthropic est celui que vous ne pouvez pas utiliser

Anthropic a annoncé deux modèles Claude 5 le 9 juin 2026. Même classe de modèles sous-jacente, deux produits, deux portes.

Claude Fable 5 est le modèle public, à 10 dollars par million de jetons d'entrée et 50 dollars par million de jetons de sortie. Claude Mythos 5 est réservé aux partenaires du projet Glasswing, aux collaborateurs gouvernementaux et aux futurs programmes d'accès de confiance. Les données cartographiées de BenchLM placent les deux en tête des classements actuels d'Anthropic, devant Claude Opus 4.8 et le cluster GPT et Gemini environnant. Les scores sont la partie facile. Ce qui est intéressant, c'est ce qu'Anthropic a construit autour du modèle.

Il y a deux mois, cette classe de modèles était trop capable pour être diffusée largement. Anthropic l'avait dit. Aujourd'hui, elle a quand même été lancée, sous une forme où certaines requêtes ne l'atteignent jamais. Fable 5 conserve des garde-fous sur la cybersécurité, la biologie, la chimie et les travaux de distillation ; dans certains clients Claude, les requêtes à haut risque sont routées vers Claude Opus 4.8, et dans l'API Messages, elles sont bloquées à moins que le développeur n'opte pour le repli. Anthropic affirme que le routage ne devrait concerner que moins de 5 % des sessions. Le produit public n'est plus un modèle. C'est un modèle plus un classifieur, une politique de routage, un repli et un régime d'accès. L'IA frontière, comme l'a dit notre analyse de lancement, devient un routage de capacités plutôt qu'un point de terminaison universel.

Deux produits, une classe de modèles

Anthropic décrit Fable 5 comme un modèle de classe Mythos rendu sûr pour un usage général, particulièrement performant en ingénierie logicielle, en travail de connaissance, en vision, en recherche scientifique et dans les tâches de longue durée. Il est disponible sous le nom claude-fable-5 via l'API Claude et les principales places de marché cloud, notamment Amazon Web Services, Google Cloud et Microsoft Foundry. Les jetons d'entrée en cache bénéficient d'une remise de 90 % ; l'inférence limitée aux États-Unis est facturée 1,1 fois le prix affiché.

Selon Anthropic, Mythos 5 est le même modèle sous-jacent, avec certaines restrictions levées pour les utilisateurs vérifiés. La différence réside dans le déploiement, pas dans l'intelligence.

ProduitCapacitéAccèsPosture de sécurité
Claude Fable 5Classe MythosDisponibilité généraleGarde-fous plus repli ou blocage
Claude Mythos 5Classe MythosAccès de confiance vérifiéCertaines restrictions levées pour les travaux sensibles

Pendant des années, un nom de modèle impliquait une surface de capacités uniforme. Fable et Mythos brisent cela. La même intelligence apparaît désormais comme plusieurs produits aux politiques différentes, et le routage fait partie de la version.

Ce que les benchmarks montrent réellement

Apposez une réserve à chaque ligne ci-dessous : la plupart sont publiées par Anthropic, et la couverture indépendante par des tiers est mince le premier jour. Considérez ces chiffres comme sérieux, mais pas définitifs.

ModèleGlobalSWE-bench VerifiedSWE-bench ProTerminal-Bench 2.1OSWorld-VerifiedPrix entrée/sortie
Claude Mythos 59995.580.388.085.0restreint
Claude Fable 59695.080.084.385.0$10/$50
Claude Opus 4.89388.669.274.683.4$5/$25
Gemini 3.1 Pro9075727776.2$2/$12
GPT-5.589-58.68278.7$5/$30

SWE-bench Verified à 95.5 et 95.0 est proche du plafond de la pile de codage publique actuelle. SWE-bench Pro est la ligne la plus révélatrice car elle est plus difficile et moins saturée. Terminal-Bench 2.1 montre ce que coûte la couche de garde-fous : Mythos atteint 88.0, le Fable public 84.3. OSWorld-Verified est à égalité à 85.0.

Les écarts qui comptent sont ceux liés aux capacités agentiques. SWE-bench Pro, Terminal-Bench et OSWorld posent tous la même question : un modèle peut-il faire avancer un projet chaotique lorsque le succès exige de nombreux petits choix ? C'est là que les systèmes de classe Fable disposent d'une réelle marge de progression par rapport au reste de la cohorte.

De la retenue d'avril au routage de juin

En avril, l'histoire de Mythos était la retenue. Le modèle surpassait Claude Opus 4.6 de larges marges sur les benchmarks de codage et agentiques, et Anthropic a choisi de ne pas le publier. Les raisons étaient pratiques. Un modèle polyvalent performant en codage, en raisonnement et en utilisation d'outils est également performant pour trouver des vulnérabilités, et une fois le modèle suffisamment bon, aucune ligne nette ne sépare la recherche défensive de la recherche offensive.

Fable 5 est la réponse d'Anthropic. Plutôt que d'attendre des garde-fous parfaits, l'entreprise a scindé le déploiement. Le risque n'a pas disparu. Il s'est déplacé dans l'architecture produit. Scinder en deux le modèle le plus puissant change la façon dont l'IA est déployée, et Anthropic n'est pas seul : OpenAI a présenté GPT-5.6 Sol, Terra et Luna à la moitié du prix, limité à environ 20 partenaires approuvés par les gouvernements. L'écart de 17 jours entre les deux lancements est la lecture la plus claire de la direction que prend le marché en 2026.

L'histoire de l'autonomie derrière les modèles

Les affirmations les plus importantes de Fable ne concernent pas le chat. Elles concernent le travail de longue durée. L'annonce de lancement d'Anthropic cite Stripe, affirmant que Fable a aidé à migrer une base de code Ruby de 50 millions de lignes en environ une journée, contre une estimation manuelle interne d'environ deux mois. Les anecdotes des fournisseurs méritent le scepticisme ; elles sont sélectionnées pour un impact maximal. La direction correspond toujours au profil des benchmarks.

L'article en accès anticipé d'Ethan Mollick sur One Useful Thing montre ce que ce changement représente. Il a testé Fable en dehors du domaine de la cybersécurité. Le modèle a créé des jeux jouables à partir de prompts vagues, générant des éléments artistiques et des assets 3D à partir de code et de mathématiques parce qu'aucun générateur d'images n'était disponible. Il a produit une carte isochrone en envoyant des sous-agents pour rassembler les horaires de vol, les données ferroviaires et les vitesses routières pendant qu'il continuait à coder. Il a fonctionné neuf heures et demie d'affilée pour construire Concord, un outil de calibration des jugements humains et d'IA sur des ensembles de données de recherche. Le résultat était imparfait, et Mollick a trouvé des erreurs et des lacunes. Mais l'ampleur dépassait ce qu'il avait vu des modèles précédents, et il a présenté le nettoyage comme un travail qu'un ingénieur pourrait terminer plutôt qu'un projet à jeter.

Le flux de travail change avec cela. L'expert cesse de superviser chaque étape et commence à commander le travail, à examiner l'artefact et à corriger le résultat. La plus forte préoccupation de Mollick est le prix à payer : plus l'exécution est longue, moins le processus est visible. Des centaines de petits choix se produisent pendant que personne ne regarde, puis sont intégrés au résultat. Le modèle gagne en levier. L'humain assume toujours les conséquences.

Pour les acheteurs, la métrique passe de dollars par million de jetons au coût par tâche terminée et vérifiée. Un modèle au double du prix par jeton peut encore gagner s'il nécessite moins de nouvelles tentatives et moins de réparations humaines. Pour tous les autres, la lecture structurelle importe davantage. Le modèle s'est amélioré. La frontière qui l'entoure est devenue plus importante. La plupart des utilisateurs ne toucheront jamais Claude Mythos 5 ; ils obtiendront une version routée et gardée de la même intelligence, et travailler dans cette limite fait désormais partie de l'utilisation de la frontière.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.