Pruebas de Penetración
Fugu-Cyber de Sakana encuentra las vulnerabilidades que Claude Opus 5 fue diseñado para pasar por alto
Anthropic limitó las habilidades de seguridad de Claude Opus 5. Modelos especializados como Gemini 3.5 Flash Cyber de Google y Fugu-Cyber de Sakana lo superan en el descubrimiento de vulnerabilidades. Un argumento para probar alternativas antes de renovar licencias empresariales.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-26 · 2 min de lectura

El límite deliberado
Anthropic limitó deliberadamente las capacidades de ciberseguridad de Claude Opus 5, creando un punto ciego conocido para los flujos de trabajo de pruebas de penetración. El modelo sigue siendo competitivo: iguala casi al buque insignia de Anthropic, Fable 5, en pruebas de codificación y conocimiento, al tiempo que cuesta un 50% menos por token. Pero esa compensación significa que los equipos de seguridad que lo utilizan para operaciones de equipo rojo pueden necesitar complementar su conjunto de herramientas, como la divulgación de lanzamiento del modelo reconoció.
Los modelos especializados ya explotan la brecha
La brecha no es hipotética. Gemini 3.5 Flash Cyber de Google, un ajuste fino ligero, encontró 55 vulnerabilidades únicas confirmadas en el motor V8 JavaScript durante las pruebas, en comparación con las 36 encontradas por Claude Opus 4.6. Google afirma que el modelo está ajustado en más de 700.000 vulnerabilidades de código abierto de OSV.dev, lo que le da una ventaja basada en datos que sus propios resultados de referencia confirmaron. Fugu-Cyber de Sakana AI, un modelo de orquestación multiagente, iguala a modelos cibernéticos de frontera como GPT-5.5-Cyber y Mythos-Preview en indicadores clave, sumándose a la evidencia de que los modelos especializados pueden superar a los de propósito general en tareas de seguridad. La tendencia más amplia de los agentes de IA reescribiendo la seguridad está documentada en esta encuesta sobre ataques y defensas autónomos.
Por qué la arquitectura multiagente de Fugu-Cyber es importante
Sakana no solo está lanzando un modelo; está rechazando la idea de que un solo modelo pueda resolver la seguridad empresarial. Fugu-Cyber utiliza múltiples subagentes que validan cada posible vulnerabilidad antes de sugerir un parche, con humanos en el circuito. La empresa argumenta que el simple acceso al modelo en bruto no soluciona la seguridad empresarial sin una infraestructura y una verificación adecuadas. Fugu-Cyber admite 13 proveedores de modelos e incluye medidas contra la alucinación para mantener las afirmaciones vinculadas a resultados reales. La necesidad de herramientas de prueba tan diversas fue subrayada por la brecha de Hugging Face por un agente de IA autónomo.
El llamado práctico: probar antes de renovar
Para los equipos conscientes de la seguridad, la implicación es clara: no traten a Claude Opus 5 como una herramienta universal de equipo rojo. Antes de renovar licencias empresariales, prueben Fugu-Cyber y Gemini 3.5 Flash Cyber (donde estén disponibles) como complementos o reemplazos. El punto ciego en el diseño de Claude puede dejar brechas críticas que los modelos especializados ya están llenando. Alternativas de código abierto como el pipeline de pruebas de penetración automatizadas de VulnClaw también demuestran que el ecosistema se está moviendo más allá de la dependencia de un solo modelo. Como dice Sakana, el trabajo real está en la infraestructura posterior a la venta: construir los pipelines que hagan que los modelos sean seguros y confiables en producción.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.