Seguridad en IA
Por qué el mejor modelo general de IA sigue perdiendo frente a modelos más específicos en seguridad
Las habilidades de ciberseguridad deliberadamente limitadas de Claude Opus 5, la revisión de código en sesión de Alibaba y una nueva técnica de robo de modelos de consulta cero muestran cómo la seguridad de la IA se fragmenta en capas especializadas en lugar de converger en un modelo general confiable.

Anthropic no obtuvo una puntuación débil en ciberseguridad con Claude Opus 5 por casualidad. Limitó deliberadamente la capacidad de seguridad ofensiva del modelo, una compensación intencionada para reducir el riesgo de uso indebido. La consecuencia es que sistemas especializados como Fugu-Cyber de Sakana AI y Gemini 3.5 Flash Cyber de Google ahora superan a Opus 5 en pruebas de penetración, no porque sean más inteligentes en general, sino porque fueron construidos para exactamente un trabajo y se les permitió ser buenos en él sin un techo de seguridad que lo impidiera.
Esa es una dinámica inusual en una industria que ha pasado años vendiendo la amplitud como punto de venta. La propuesta de los laboratorios fronterizos ha sido generalmente: un modelo, competente en todo, para que no necesites una caja de herramientas. La seguridad está resultando ser el dominio donde esa propuesta se desmorona primero, porque lo que hace que un modelo sea bueno para encontrar vulnerabilidades (una exploración agresiva y exhaustiva de los puntos débiles de un sistema) es el mismo comportamiento que un equipo de seguridad tiene todas las razones para restringir en un producto de uso general utilizado por millones de personas. La elección de Anthropic no es un fracaso de ingeniería. Es una compensación legible: seguridad amplia versus capacidad estrecha, y Opus 5 eligió lo primero en este eje.
La otra cara de la misma moneda
La respuesta de Alibaba a un problema relacionado es instructiva precisamente porque no se trata en absoluto de la capacidad del modelo. Su revisión de código en sesión detecta vulnerabilidades en el código generado por IA antes de que lleguen a un repositorio, en lugar de confiar en que el modelo de codificación evite escribir código inseguro en primer lugar. Esa es una respuesta arquitectónica al mismo problema subyacente: no esperes que un modelo de propósito general también sea una puerta de seguridad confiable. En su lugar, acopla un revisor dedicado al flujo de trabajo. Si los desarrolladores realmente dejan que ese revisor se ejecute en cada commit, en lugar de desactivarlo bajo presión de plazos, es la verdadera pregunta abierta que el despliegue de Alibaba debe responder.
Mientras tanto, el lado de la amenaza de este panorama tampoco se queda quieto. Un ataque de consulta cero recientemente documentado permite a los adversarios extraer modelos propietarios de APIs en la nube utilizando solo datos de temporización y canales laterales de memoria, sin enviar una sola consulta que el proveedor pudiera registrar o marcar. Ese es un modelo de amenaza significativamente diferente de las preocupaciones de inyección de avisos y jailbreak que han dominado la cobertura de seguridad de la IA. Se dirige a la infraestructura, no al juicio del modelo, y ninguna cantidad de limitación de capacidad en el modelo mismo hace algo para detenerlo.
Lo que esto suma
Junta estos tres desarrollos y surge un panorama: la seguridad de la IA se está fragmentando en capas especializadas en lugar de consolidarse en un modelo general confiable. Las pruebas de seguridad ofensiva se están moviendo a sistemas construidos para un propósito, libres de las restricciones que necesita un producto de consumo. La revisión de código defensiva se está moviendo a herramientas dedicadas acopladas al flujo de trabajo de desarrollo, en lugar de confiar en el propio juicio del modelo de codificación. Y las amenazas a nivel de infraestructura, como el robo de modelos, requieren nuevamente un tipo diferente de defensa, que no tiene nada que ver con lo capaz o seguro que sea el modelo en sí.
Para cualquier empresa que renueve un contrato de seguridad de IA asumiendo que un modelo general líder es automáticamente la herramienta de seguridad líder, esa suposición ya no se sostiene. El movimiento práctico es probar alternativas estrechas y construidas para un propósito contra el trabajo específico en cuestión: pruebas de penetración, revisión de código, detección de amenazas, en lugar de asumir que el modelo más inteligente en la sala también es el mejor para defenderla.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.