Modelos de IA
Claude Opus 5 iguala el rendimiento casi de frontera a la mitad del costo, con un punto ciego deliberado en ciberseguridad
Claude Opus 5 se lanza con puntuaciones casi al nivel de Fable en puntos de referencia de codificación y conocimiento a la mitad del precio. Pero sus capacidades de ciberseguridad deliberadamente debilitadas crean una clara compensación para los desarrolladores.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-24 · 3 min de lectura

Claude Opus 5 está disponible hoy, y las cifras son sorprendentes. En Frontier-Bench v0.1, el modelo supera a todos los demás modelos probados, duplicando con creces la puntuación de su predecesor Opus 4.8 a un costo menor por tarea. En CursorBench 3.2, se sitúa dentro del 0.5% de la puntuación máxima de Fable 5 mientras cuesta la mitad por tarea. En ARC-AGI 3, una evaluación que mide la capacidad de resolver problemas novedosos, Opus 5 obtiene tres veces más puntuación que el siguiente mejor modelo.
El precio se mantiene igual que el de Opus 4.8: $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Eso sitúa la inteligencia casi de frontera a una fracción del precio de Fable 5, convirtiéndolo en el modelo predeterminado en Claude Max y el modelo más fuerte en Claude Pro.
Pero las cifras destacadas vienen con una advertencia. Anthropic entrenó deliberadamente a Opus 5 para evitar avanzar capacidades en ciberseguridad ofensiva. El modelo encuentra vulnerabilidades a un ritmo cercano a Mythos 5 (su hermano enfocado en ciberseguridad), pero tiene dificultades para convertir esas vulnerabilidades en exploits funcionales. En el benchmark OSS-Fuzz, Opus 5 y Mythos 5 identifican errores a tasas similares, pero la puntuación de desarrollo de exploits de Opus 5 queda muy rezagada.
Esto es intencional. Los clasificadores de seguridad de Anthropic en Opus 5 bloquean el escaneo de vulnerabilidades basado en binarios, las pruebas de penetración y la generación de exploits. Las solicitudes marcadas recurren a Opus 4.8 por defecto, y las empresas pueden acceder a una versión menos restringida a través del Programa de Verificación Cibernética.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| Frontier-Bench v0.1 | Mejor (supera a todos) | Por debajo de Opus 5 | Menos de la mitad de Opus 5 |
| CursorBench 3.2 | Dentro del 0.5% de Fable 5 | Máximo | Inferior |
| ARC-AGI 3 | 3x el siguiente mejor | N/A | Inferior |
| Tasa de aprobación de Zapier AutomationBench | 1.5x el siguiente mejor al mismo costo | N/A | Inferior |
| Desarrollo de exploits OSS-Fuzz | Muy por detrás de Mythos 5 | N/A | N/A |
En uso real, los evaluadores iniciales describen un modelo que piensa antes de actuar. Un ingeniero de una firma de trading usó Opus 5 para construir un feed de datos de mercado para un nuevo intercambio en una sola sesión, algo que modelos anteriores no podían completar ni con una guía extensa. Otro evaluador le dio a Opus 5 un rol de jefe de personal sobre sus entornos de desarrollo, y el modelo construyó su propio monitor y manejó cada máquina de forma independiente.
El modelo también muestra una autoverificación más fuerte. Ante una tarea sin forma directa de ver un dibujo, escribió su propio pipeline de visión artificial para extraer geometría de píxeles en bruto. Cuando se le pidió corregir un error en un gestor de paquetes popular, encontró la causa raíz y parcheó un caso límite que la propia solución de la comunidad había pasado por alto.
En biología e investigación científica, Opus 5 es una clara mejora respecto a Opus 4.8, con mejoras en las evaluaciones de ciencias de la vida, especialmente en química orgánica y tareas relacionadas con proteínas. Sin embargo, todavía está por debajo de Mythos 5 en tareas de investigación autónoma prolongadas, que Anthropic señala como el área más riesgosa para aplicaciones biológicas.
Anthropic también está introduciendo dos funciones junto con el lanzamiento: cambios de herramientas en medio de la conversación en la Plataforma Claude (permitiendo a los desarrolladores cambiar herramientas sin invalidar la caché de prompt), y retrocesos automáticos en la API (las solicitudes marcadas se enrutan a otro modelo en lugar de ser bloqueadas).
Para los equipos que deciden entre Opus 5 y Fable 5, las cuentas son claras: Opus 5 te da la mayor parte del razonamiento de Fable a la mitad del costo, pero pierdes la ventaja en tareas cibernéticas y en algunas de las investigaciones autónomas más difíciles. Para la mayoría del trabajo de codificación y conocimiento, es el mejor controlador diario.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.