SevenTnewS

Inteligencia Artificial

Un nuevo ataque de caja negra revela que los agentes de navegación visión-lenguaje son fácilmente desviados por ruido similar al de una lente

AdvNav es un ataque adversarial de caja negra que utiliza ruido Perlin similar al de una lente para confundir a los agentes de navegación visión-lenguaje. Al observar solo el comportamiento del agente, no sus pesos internos, el método logró hasta un 87% de tasa de éxito de ataque. El marco revela una amplia vulnerabilidad en los sistemas VLN actuales.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-28 · 4 min de lectura

Un nuevo ataque de caja negra revela que los agentes de navegación visión-lenguaje son fácilmente desviados por ruido similar al de una lente
Fuentes : Research paper:…

Los agentes de navegación visión-lenguaje están diseñados para seguir comandos en lenguaje natural a través de espacios interiores desconocidos, guiados por una transmisión de cámara en vivo. Un nuevo ataque adversarial muestra que estos sistemas pueden ser desviados por ruido visual sutil, similar al de una lente, que imita algo tan común como niebla o polvo en una lente. El atacante nunca necesita ver el interior del modelo.

Investigadores de la Universidad de Ciencia y Tecnología de Hong Kong (Guangzhou) y la Universidad Sun Yat-sen construyeron AdvNav, un método totalmente de caja negra que inyecta distorsiones espacialmente coherentes en la vista en primera persona del agente. El atacante solo necesita acceso de consulta: alimentar imágenes modificadas y observar hacia dónde va el agente. No se requieren gradientes, detalles de arquitectura ni datos de entrenamiento.

El método funciona construyendo un bucle de retroalimentación a partir del comportamiento del propio agente. AdvNav calcula dos señales: una puntuación a nivel de trayectoria que mide cuánto se desvía el agente de su objetivo, y una puntuación de recompensa a nivel de acción que estima la probabilidad de elegir pasos incorrectos en el camino. Una bandera binaria rastrea si el agente ya ha abandonado su ruta prevista. Juntas, estas señales impulsan una optimización híbrida que ajusta la intensidad de la perturbación como un termostato adaptativo mientras evoluciona la estructura del ruido a través de algoritmos genéticos.

En pruebas con el conjunto de datos Room-to-Room (R2R) dentro del simulador Matterport3D, AdvNav se enfrentó a dos tipos de modelos VLN: el basado en Transformer HAMT y el basado en LLM MapGPT ejecutándose en los backbones Qwen3-VL y GPT-4V. Contra HAMT, AdvNav logró una tasa de éxito de ataque promedio del 49.70%, lo que significa que casi la mitad de todas las navegaciones previamente exitosas fallaron bajo el ataque. El éxito ponderado por la longitud de la trayectoria cayó del 57.69% al 29.35%, y el error de navegación creció de 3.94 metros a 6.05 metros.

Contra MapGPT con Qwen3-VL, la tasa de éxito de ataque subió al 65.96%. Con GPT-4V, alcanzó el 87.30%, y el SPL cayó a solo el 4.71%. El ataque funcionó mejor en agentes basados en LLM, que los autores sospechan pueden ser más vulnerables a perturbaciones globales debido a que dependen en gran medida del razonamiento visual holístico.

El ruido que utiliza AdvNav proviene del ruido Perlin, un campo de luminancia continuo y de baja frecuencia que se asemeja a efectos ambientales naturales como la neblina o las manchas en la lente. La elección es deliberada. A diferencia del ruido gaussiano de alta frecuencia o las occlusiones de máscara localizadas, el ruido Perlin resiste los filtros de preprocesamiento estándar y crea un sesgo perceptual constante. La puntuación LPIPS para las perturbaciones de AdvNav fue mucho más baja que las líneas base, lo que sugiere que es más difícil de notar para un observador humano.

Los autores escriben: "Nuestra perturbación forma un campo de luminancia coherente y de baja frecuencia similar a la neblina o el polvo en la lente. Reduce el contraste a lo largo de las señales estructurales y resiste la supresión por preprocesamiento estándar, lo que conduce a un sesgo continuo en la acción de navegación que se acumula a lo largo de las trayectorias."

Este trabajo se diferencia de ataques VLN anteriores que requerían acceso de caja blanca, es decir, la capacidad de calcular o aproximar los gradientes del modelo, algo a menudo imposible en implementaciones del mundo real donde los modelos son propietarios. Los métodos de caja negra existentes como ZOO, NES o SimBA fueron diseñados para tareas de visión de un solo paso y funcionan mal en la tarea VLN de múltiples pasos y temporalmente dependiente, donde los agentes pueden autocorregirse y los errores se acumulan de formas no lineales.

Los estudios de ablación confirmaron que cada componente de AdvNav es importante. Eliminar ambas señales de retroalimentación redujo la tasa de éxito de ataque al 23.40% (búsqueda aleatoria pura). Eliminar solo la puntuación a nivel de acción la redujo al 30.85%. Fijar la estructura del ruido mientras se mantenía la actualización adaptativa arrojó un 38.30%, todavía muy por debajo del 47.87% del método completo en un subconjunto. Reemplazar el optimizador de AdvNav con NES, búsqueda bayesiana o SimBA mientras se mantenía el ruido Perlin también produjo ataques más débiles.

Los investigadores sugieren que AdvNav sirve no solo como un método de ataque o herramienta de prueba de estrés para sistemas VLN, sino también como un avance para futuras investigaciones sobre robustez. Las defensas potenciales incluyen entrenamiento adversarial o filtros de preprocesamiento sintonizados a patrones de perturbación similares a Perlin.

El artículo está programado para aparecer en la 34ª Conferencia Internacional de ACM sobre Multimedia (MM 2026) en Río de Janeiro.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.