Ciberseguridad
El ajuste fino cibernético de Google encuentra vulnerabilidades que Claude Opus 4.6 no detecta
El ajuste fino Gemini 3.5 Flash Cyber de Google supera a Claude Opus 4.6 en el descubrimiento de vulnerabilidades, encontrando 55 problemas únicos frente a 36 en el motor V8. El modelo ligero está restringido a gobiernos y socios de confianza mediante un piloto de acceso limitado.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-24 · 4 min de lectura

Google ha estado ejecutando herramientas de descubrimiento de vulnerabilidades dentro de sus propias bases de código durante años. Chrome, Android y YouTube se escanean regularmente, y equipos internos como el grupo de Investigación de Vulnerabilidades en la Nube ya utilizan agentes automatizados para encontrar errores antes de que lo hagan los atacantes. Lo que cambió esta semana es el modelo detrás de esos agentes.
Gemini 3.5 Flash Cyber es una versión ajustada del modelo 3.5 Flash, optimizada específicamente para tareas de ciberseguridad: encontrar vulnerabilidades, validarlas y generar parches. Google lo pone a disposición a través de un piloto de acceso limitado para gobiernos y socios de confianza mediante su plataforma CodeMender, y la compañía se negó a decir cuándo o si podría haber un acceso más amplio.
Los resultados de los puntos de referencia internos merecen atención. En el benchmark CyberGym, que prueba agentes de IA contra cientos de vulnerabilidades del mundo real, 3.5 Flash Cyber obtuvo puntuaciones competitivas con modelos mucho más grandes. Google configuró CodeMender para llamar al modelo hasta cinco veces por vulnerabilidad y luego agregar los resultados en un informe final. Esa arquitectura, llamadas pequeñas, baratas y repetidas en lugar de una inferencia costosa de un modelo grande, es la elección de diseño central.
En la evaluación interna Big Sleep de Google centrada en Chrome y Safari, el modelo ajustado superó significativamente tanto a 3.5 Flash estándar como al más reciente 3.6 Flash. La brecha se amplió aún más en el pipeline de escaneo de commits de producción de Chrome, donde 3.5 Flash Cyber encontró vulnerabilidades que los modelos anteriores no detectaron en absoluto.

La comparación más llamativa es en el motor V8 JavaScript, una base de código notoriamente compleja que impulsa la ejecución de JavaScript en Chrome. En un número fijo de invocaciones, 3.5 Flash Cyber encontró 55 problemas confirmados únicos. 3.5 Flash estándar encontró 47. Claude Opus 4.6, el modelo más grande y costoso de Anthropic, encontró 36. Diez de los problemas detectados por 3.5 Flash Cyber no fueron detectados por ninguno de los otros dos modelos.
Ese patrón, un modelo ligero que captura más vulnerabilidades únicas que uno más grande y costoso, es el hallazgo central que Google quiere comunicar. La explicación es sencilla: ejecutar muchas inferencias baratas permite al agente explorar más rutas de código que una sola llamada costosa. Los modelos más grandes pueden quedarse atascados en el primer hallazgo plausible y dar vueltas allí, mientras que un enjambre de inferencias rápidas lanza una red más amplia.
El equipo de Investigación de Vulnerabilidades en la Nube de Google puso el modelo en práctica. En dos horas, 3.5 Flash Cyber encontró vulnerabilidades de ejecución remota de código en API públicas y descubrió una vulnerabilidad de corrupción de memoria en un servicio de producción sensible. Luego generó un exploit de ejecución remota de código 100 % fiable que eludió la Aleatorización del Diseño del Espacio de Direcciones (ASLR) y Write XOR Execute (W^X), dos técnicas de mitigación estándar.
Google es cuidadoso al señalar la naturaleza de doble uso de la tecnología. El piloto de acceso limitado está explícitamente diseñado para dar a los defensores una ventaja inicial mientras se previene un uso indebido más amplio. La compañía dice que ampliará el acceso con el tiempo, pero no ha fijado una fecha para una disponibilidad más amplia.
Por separado, las capacidades fundamentales de CodeMender ya están disponibles para cualquier cliente a través de la Plataforma de Agentes Empresariales Gemini, utilizando modelos Gemini disponibles de forma general en lugar de la variante cibernética ajustada.
La conclusión general tiene menos que ver con 3.5 Flash Cyber específicamente y más con la tendencia que representa: el ajuste fino especializado en modelos pequeños puede superar a la escalada por fuerza bruta. Google tiene una década de datos de vulnerabilidades de OSV.dev, que cubre más de 700,000 vulnerabilidades de código abierto, y de resultados de OSS-Fuzz que se remontan a más de diez años. Ese corpus le permite entrenar un modelo sobre cómo trabajan los profesionales de seguridad reales, en lugar de con ejemplos sintéticos. El modelo aprende a operar herramientas estándar de la industria, leer a través de millones de líneas de código en proyectos como Chromium y manejar tareas que requieren horas de análisis continuo.
La ventaja de velocidad también es real. Los modelos ligeros se pueden integrar en escaneos frecuentes, procesos de lanzamiento sensibles al tiempo y pipelines de escaneo de commits a escala. Un modelo más lento y costoso podría ser mejor en razonamiento profundo en una sola ruta de código, pero el trabajo de seguridad a menudo se beneficia de la amplitud sobre la profundidad.
Nada de esto significa que los modelos grandes sean inútiles para la ciberseguridad. Opus 4.6 y otros aún superan en tareas de razonamiento complejas que requieren una comprensión profunda de un problema específico. Pero los resultados de Google sugieren que para la tarea específica de encontrar vulnerabilidades desconocidas en una base de código grande, los modelos ajustados más baratos con arquitecturas de múltiples inferencias ya son competitivos y, en algunos casos, mejores.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.