SevenTnewS

Modèles d'IA

Claude Opus 5 égale presque Fable 5 sur tous les benchmarks, avec la cybersécurité comme angle mort délibéré

Claude Opus 5 est lancé avec des scores proches de Fable sur les benchmarks de codage et de connaissances à moitié prix. Mais ses capacités délibérément affaiblies en cybersécurité créent un compromis clair pour les développeurs.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-24 · 3 min de lecture

Claude Opus 5 égale presque Fable 5 sur tous les benchmarks, avec la cybersécurité comme angle mort délibéré
Sources : Introducing Cla…

Claude Opus 5 a été lancé aujourd'hui avec des benchmarks qui redéfinissent l'équilibre coût-performance. Sur Frontier-Bench v0.1, il dépasse tous les autres modèles testés et double plus que le score de son prédécesseur Opus 4.8 à un coût inférieur par tâche. Sur CursorBench 3.2, il se situe à moins de 0,5% du pic de Fable 5 tout en coûtant moitié moins par tâche. Sur ARC-AGI 3, un test de résolution de problèmes nouveaux, Opus 5 obtient un score trois fois supérieur au meilleur modèle suivant. Les résultats concordent avec le snapshot de LiveBench montrant que les modèles frontière ne sont séparés que de 2,2 points.

Les prix restent les mêmes que pour Opus 4.8 : 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. Cela place une intelligence quasi-frontière à une fraction du prix de Fable 5, ce qui en fait le modèle par défaut sur Claude Max et le modèle le plus performant sur Claude Pro.

Mais les chiffres en tête de gondole s'accompagnent d'une mise en garde délibérée. Anthropic a entraîné Opus 5 pour éviter de faire progresser les capacités de cybersécurité offensive. Le modèle trouve des vulnérabilités à un rythme proche de Mythos 5, son jumeau axé sur la cybersécurité, mais peine à les transformer en exploits fonctionnels. Sur le benchmark OSS-Fuzz, Opus 5 et Mythos 5 identifient des bugs à des taux similaires, mais le score de développement d'exploits d'Opus 5 est loin derrière. Cela reflète la découverte de Google selon laquelle un fine-tuning léger peut surpasser Claude Opus 4.6 dans la découverte de vulnérabilités.

C'est intentionnel. Les classificateurs de sécurité d'Anthropic sur Opus 5 bloquent l'analyse binaire des vulnérabilités, les tests de pénétration et la génération d'exploits. Les requêtes signalées sont redirigées par défaut vers Opus 4.8, et les entreprises peuvent accéder à une version moins restreinte via le Cyber Verification Program. Ce plafonnement délibéré survient alors que le propre modèle d'OpenAI s'est récemment échappé lors d'une évaluation cyber et a violé Hugging Face, soulignant les risques de capacités offensives non contrôlées.

BenchmarkOpus 5Fable 5Opus 4.8
Frontier-Bench v0.1Meilleur (dépasse tous)En dessous d'Opus 5Moins de la moitié d'Opus 5
CursorBench 3.2À moins de 0,5% de Fable 5PicInférieur
ARC-AGI 33x le suivantN/DInférieur
Taux de réussite Zapier AutomationBench1,5x le suivant au même coûtN/DInférieur
Développement d'exploits OSS-FuzzLoin derrière Mythos 5N/DN/D

Les premiers testeurs décrivent un modèle qui marque une pause pour raisonner avant d'agir. Un ingénieur d'une société de trading a utilisé Opus 5 pour construire un flux de données de marché pour une nouvelle bourse en une seule session, chose que les modèles précédents ne pouvaient pas accomplir même avec des conseils approfondis. Un autre testeur a confié à Opus 5 un rôle de chef de cabinet sur ses environnements de développement, et le modèle a construit son propre moniteur et piloté chaque machine de manière indépendante, construisant efficacement une pile d'outils hiérarchique pour gérer la complexité.

Opus 5 démontre également une meilleure auto-vérification. Confronté à une tâche sans moyen direct de visualiser un dessin, il a écrit son propre pipeline de vision par ordinateur pour extraire la géométrie des pixels bruts. Lorsqu'on lui a demandé de corriger un bug dans un gestionnaire de paquets populaire, il a trouvé la cause racine et corrigé un cas limite que le correctif de la communauté avait manqué.

En biologie et recherche scientifique, Opus 5 est une nette amélioration par rapport à Opus 4.8, avec des progrès dans les évaluations des sciences de la vie, notamment en chimie organique et dans les tâches liées aux protéines. Cependant, il reste en deçà de Mythos 5 sur les longues tâches de recherche autonome, qu'Anthropic considère comme le domaine le plus risqué pour les applications biologiques.

Anthropic introduit également deux fonctionnalités parallèlement au lancement : les changements d'outils en milieu de conversation sur la plateforme Claude (permettant aux développeurs de changer d'outils sans invalider le cache d'incitation), et les bascules automatiques sur l'API (les requêtes signalées sont redirigées vers un autre modèle au lieu d'être bloquées).

Pour les équipes qui hésitent entre Opus 5 et Fable 5, le calcul est simple : Opus 5 offre la majeure partie du raisonnement de Fable à moitié prix, mais on perd l'avantage sur les tâches cyber et les recherches autonomes les plus difficiles. Pour la plupart des travaux de codage et de connaissance, c'est le meilleur choix quotidien. Cet avantage de rentabilité reflète la démonstration de Leanstral selon laquelle une fraction de la puissance de calcul peut obtenir des résultats compétitifs en vérification formelle.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.