SevenTnewS

Tests d'intrusion

Fugu-Cyber de Sakana trouve les vulnérabilités que Claude Opus 5 a été conçu pour manquer

Anthropic a limité les compétences en sécurité de Claude Opus 5. Des modèles spécialisés comme le Gemini 3.5 Flash Cyber de Google et le Fugu-Cyber de Sakana le surpassent dans la découverte de vulnérabilités. Un argument pour tester des alternatives avant de renouveler les licences d'entreprise.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-26 · 2 min de lecture

Fugu-Cyber de Sakana trouve les vulnérabilités que Claude Opus 5 a été conçu pour manquer
Sources : Security Trade-…·Claude Opus 5 n…·Google's cheap …·Sakana's new cy…·Google's three-…·Google's cheap …·AI agents just …

La limitation délibérée

Anthropic a délibérément limité les capacités de cybersécurité de Claude Opus 5, créant un angle mort connu pour les workflows de tests d'intrusion. Le modèle reste compétitif : il se rapproche presque du vaisseau amiral d'Anthropic, Fable 5, sur les benchmarks de codage et de connaissances, tout en coûtant 50 % de moins par token. Mais ce compromis signifie que les équipes de sécurité qui l'utilisent pour le red-teaming pourraient avoir besoin de compléter leur chaîne d'outils, comme la divulgation du lancement du modèle l'a elle-même reconnu.

Des modèles spécialisés exploitent déjà ce vide

Ce vide n'est pas hypothétique. Gemini 3.5 Flash Cyber de Google, une version légère affinée, a trouvé 55 vulnérabilités confirmées uniques dans le moteur JavaScript V8 lors des tests, contre 36 trouvées par Claude Opus 4.6. Google affirme que le modèle est affiné sur plus de 700 000 vulnérabilités open source provenant d'OSV.dev, lui conférant un avantage basé sur les données que ses propres résultats de benchmark ont confirmé. Fugu-Cyber de Sakana AI, un modèle d'orchestration multi-agents, égale les modèles de cybersécurité de pointe comme GPT-5.5-Cyber et Mythos-Preview sur des benchmarks clés, ajoutant à la preuve que les modèles spécialisés peuvent surpasser les modèles généralistes dans les tâches de sécurité. La tendance plus large des agents IA qui réécrivent la sécurité est documentée dans cette enquête sur les attaques et défenses autonomes.

Pourquoi l'architecture multi-agents de Fugu-Cyber est importante

Sakana ne se contente pas de publier un modèle ; elle s'oppose à l'idée qu'un seul modèle peut résoudre la sécurité des entreprises. Fugu-Cyber utilise plusieurs sous-agents qui valident chaque vulnérabilité potentielle avant de suggérer un correctif, avec des humains dans la boucle. L'entreprise soutient que l'accès brut au modèle seul ne résout pas la sécurité de l'entreprise sans infrastructure et vérification appropriées. Fugu-Cyber prend en charge 13 fournisseurs de modèles et inclut des mesures anti-hallucination pour lier les affirmations à des résultats réels. Le besoin d'outils de test aussi diversifiés a été souligné par la brèche de Hugging Face par un agent d'IA autonome.

L'appel pratique : tester avant de renouveler

Pour les équipes soucieuses de la sécurité, l'implication est claire : ne traitez pas Claude Opus 5 comme un outil de red-teaming universel. Avant de renouveler les licences entreprise, testez Fugu-Cyber et Gemini 3.5 Flash Cyber (là où disponibles) comme compléments ou remplacements. L'angle mort dans la conception de Claude peut laisser des lacunes critiques que des modèles spécialisés comblent déjà. Les alternatives open source comme le pipeline de pentesting automatisé de VulnClaw démontrent également que l'écosystème évolue au-delà de la dépendance à un seul modèle. Comme le dit Sakana, le vrai travail se trouve dans l'infrastructure post-vente : construire les pipelines qui rendent les modèles sûrs et fiables en production.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.