Alerta de ciberseguridad
Ataques de robo de modelos en IA basada en la nube: surge un nuevo método troyano de cero consultas
Un nuevo método de ataque de cero consultas llamado 'Zero-Query Model Stealing' permite a los adversarios robar modelos de IA propietarios de APIs en la nube sin enviar ninguna consulta, utilizando información de canal lateral de patrones de temporización y memoria. Esto plantea serias preocupaciones de ciberseguridad para los proveedores de IA como servicio.

Los servicios de inteligencia artificial basados en la nube, desde GPT-4 de OpenAI hasta Gemini de Google y Claude de Anthropic, son cada vez más tratados como joyas de la corona por sus desarrolladores, protegidos por capas de cifrado, autenticación y políticas de uso. Pero un nuevo método de ataque presentado en la Conferencia ACM sobre Seguridad Informática y Comunicaciones (CCS) esta semana desafía esas defensas a un nivel fundamental.
Denominado "Zero-Query Model Stealing" (ZQMS), la técnica puede reconstruir la arquitectura de un modelo víctima, los tamaños de los pesos e incluso aproximar hiperparámetros observando solo las señales de canal lateral generadas durante la inferencia, sin que el atacante realice nunca una sola llamada a la API.
Cómo funciona
El ataque es engañosamente simple en concepto, aunque técnicamente sofisticado en ejecución. Los investigadores descubrieron que las plataformas en la nube a menudo despliegan múltiples modelos de IA en hardware compartido, un servidor GPU o TPU. Al colocar un proceso malicioso en la misma máquina física (lograble mediante instancias en la nube como las instancias GPU de AWS EC2), un atacante puede monitorear patrones de acceso a memoria, comportamiento de caché y variaciones de temporización.
"Cuando un modelo procesa una consulta de usuario, realiza una secuencia específica de multiplicaciones de matrices, operaciones de atención y normalizaciones de capas", explica el Dr. Li Xia, autor principal del estudio e investigador de la Universidad de Tsinghua. "Estas operaciones dejan una 'huella digital' distinta en los contadores de hardware y la latencia de memoria. Entrenamos una pequeña red neuronal para decodificar esa huella digital en una reconstrucción de la arquitectura del modelo original."
La naturaleza de cero consultas del ataque es su característica más alarmante. El robo de modelos tradicional requiere miles de consultas a la API (a menudo costosas) para entrenar un modelo sustituto que imite al original. ZQMS lo elude por completo, lo que hace que sea mucho más difícil de detectar.
Implicaciones para la seguridad y la propiedad intelectual
Para empresas como OpenAI, Anthropic y Meta AI, cuyos modelos de negocio dependen de la naturaleza propietaria de sus modelos, las implicaciones son graves. Un ataque ZQMS exitoso podría permitir a un competidor clonar la arquitectura y el pipeline de entrenamiento de un modelo, sorteando años de investigación y miles de millones de dólares en inversión.
"Esto es un cambio de paradigma en la seguridad de los modelos", dice el Dr. William Grant, experto en ciberseguridad del MIT. "Hasta ahora, el modelo de amenaza asumía que el atacante necesitaría interacción directa. Esto demuestra que simplemente alojar un modelo en infraestructura compartida en la nube es suficiente para filtrar sus secretos."
Se informa que el ataque funciona tanto en LLM basados en transformadores como en redes neuronales convolucionales utilizadas para reconocimiento de imágenes. El equipo robó con éxito aproximaciones de arquitecturas populares, incluyendo GPT-2 (un proxy para LLM más grandes) y ResNet-50 en las plataformas Google Cloud y AWS. No intentaron robar GPT-4 u otros modelos cerrados, pero afirman que la técnica debería escalar.
Mitigaciones y el camino a seguir
Los investigadores sugieren varias contramedidas. Primero, los proveedores de nube podrían desplegar modelos en hardware dedicado y aislado para prevenir ataques de co-ubicación. Segundo, podrían ofuscar los patrones de acceso a memoria inyectando operaciones ficticias o usando implementaciones de tiempo constante de capas críticas. Tercero, los enclaves seguros, como Intel SGX o AMD SEV, podrían proteger los pesos del modelo incluso desde un hipervisor comprometido.
Los principales proveedores de nube han sido notificados. Google y Amazon Web Services emitieron declaraciones enfatizando su compromiso con la seguridad y señalando que están evaluando los hallazgos del artículo. OpenAI declinó hacer comentarios, pero según informes está trabajando en un informe técnico en respuesta.
El ataque resalta una creciente tensión en la industria de la IA: el impulso por una inferencia más rápida y barata a través de hardware compartido versus la necesidad de proteger una propiedad intelectual cada vez más valiosa. A medida que los modelos de IA se integran en todo, desde la atención médica hasta las finanzas, lo que está en juego con el robo de modelos se dispara.
El artículo de ZQMS está disponible en arXiv y se presentará en un taller dedicado de CCS sobre aprendizaje automático adversarial el próximo mes. Los autores han lanzado una herramienta de detección de prueba de concepto para ayudar a los proveedores de nube a identificar posibles fugas de canal lateral, pero enfatizan que una defensa integral requiere cambios a nivel de hardware.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.