SevenTnewS

IA multimodal

Por qué los modelos de visión-lenguaje necesitan una ventana de retransmisión visual para dejar de alucinar

Una nueva investigación revela una redistribución estable de tres etapas de la atención multimodal en los VLM, operacionalizada como la Ventana de Retransmisión Visual (VRW). El marco TRACE utiliza módulos ligeros entrenados para programar esta ventana por tarea, mejorando los puntos de referencia sensibles al anclaje en un promedio de 4,33 puntos y hasta 6,6 puntos.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-23 · 3 min de lectura

Por qué los modelos de visión-lenguaje necesitan una ventana de retransmisión visual para dejar de alucinar

Los modelos de visión-lenguaje pueden responder preguntas sobre imágenes bastante bien en este punto. Pero cuando alucinan, describiendo objetos que no están ahí o interpretando mal las relaciones espaciales, a menudo no es porque la información visual falte. El modelo simplemente perdió su rastro en algún lugar dentro de su propia pila de razonamiento.

Una nueva investigación de la Universidad de Tongji y la Universidad Politécnica de Hong Kong, publicada en arXiv, ofrece el relato mecanicista más detallado hasta la fecha de cómo sucede esto y qué hacer al respecto. Los autores identifican un ritmo interno de tres etapas a través de las capas del transformador de los VLM, formalizan la etapa intermedia crítica como la Ventana de Retransmisión Visual (VRW) e introducen un marco de control ligero en tiempo de inferencia llamado TRACE que programa adaptativamente esta ventana según lo que necesita cada pregunta.

El ritmo de tres etapas de la atención multimodal

Los investigadores rastrearon dos sondas de atención a través de capas de diez VLM de peso abierto, incluidas variantes de Qwen-VL, InternVL y LLaVA. La primera sonda midió cuán fuertemente los tokens de respuesta miran hacia atrás a la pregunta. La segunda midió cuán fuertemente los tokens visuales se atienden entre sí. Encontraron un patrón consistente en todos los modelos: las primeras capas enfatizan la organización condicionada por la pregunta, las capas medias cambian a la consolidación intravisual y las capas posteriores regresan a la formación de respuestas.

Esa fase intermedia, la Ventana de Retransmisión Visual, es donde la evidencia visual se ensambla activamente antes de ser entregada al lado del lenguaje para el razonamiento. Su geometría no es fija. Las tareas con muchos detalles, como contar, tienden a necesitar ventanas de retransmisión más largas y tardías, mientras que las tareas de razonamiento de alto nivel se benefician de una entrega más temprana.

Por qué surgen respuestas sin respaldo

El estudio demuestra un vínculo causal entre el desajuste de retransmisión y la alucinación. Usando el punto de referencia HaloQuest, los autores compararon continuaciones ancladas y sin respaldo generadas a partir de los mismos pares imagen-pregunta. Las respuestas sin respaldo mostraron consistentemente ventanas de retransmisión más estrechas, terminación más temprana de la retransmisión y un anclaje visual más débil después de la entrega. En un experimento de parcheo, reemplazar las activaciones residuales de los tokens visuales dentro de la VRW estimada con activaciones de rama anclada recuperó respuestas correctas en el 41,4% de los casos sin respaldo. En comparación, los parches previos a la retransmisión recuperaron solo el 8,7%, y los parches posteriores a la retransmisión el 11,2%.

Las variantes de pensamiento de los mismos modelos base (por ejemplo, Qwen3-VL-4B Instruct vs. Thinking) mostraron una mejor alineación de retransmisión con las demandas de la tarea y un anclaje más fuerte posterior a la entrega. Esto sugiere que su ventaja proviene en parte de una programación interna más apropiada de la evidencia visual.

TRACE: programación del soporte visual sin reentrenar el modelo

Basándose en estos hallazgos, el equipo construyó TRACE (Anclaje de Retransmisión Adaptativo a la Tarea y Programación de Evidencia Controlada), un marco con solo 199,244 parámetros entrenables para modelos de 4B y 297,548 para modelos de 8B. Funciona en tres etapas. Un MLP ligero predice la puntuación de retransmisión de cada capa a partir de estadísticas de atención de tiempo de llenado previo. Un programador consciente de la tarea expande o contrae la ventana de retransmisión aplicando un sesgo suave a los logits de atención visual a visual. Un módulo de anclaje posterior a la entrega preserva el acceso al soporte visual seleccionado durante la generación de respuestas, con la fuerza modulada por la incertidumbre de decodificación.

Los módulos se entrenan a partir de pseudoetiquetas inducidas por el estimador de VRW, manteniendo congelado el VLM base. El entrenamiento toma aproximadamente 8 horas en cuatro GPU NVIDIA RTX 5090.

Resultados: ganancias de anclaje sin compensaciones

TRACE fue evaluado en cuatro backbones de peso abierto (Qwen3-VL-4B/8B e InternVL3.5-4B/8B) en siete puntos de referencia que cubren comprensión de documentos, razonamiento visual y entornos sensibles a alucinaciones. En los puntos de referencia sensibles al anclaje (HallusionBench, VlmsAreBlind, CountBench), ofreció una mejora promedio de 4,33 puntos, con ganancias de hasta 6,6 puntos en HallusionBench con InternVL3.5-8B. También mejoró puntos de referencia con mucho razonamiento como MathVista, lo que sugiere que el mecanismo aborda tanto la alucinación como el razonamiento lógico a través de un único principio de control subyacente.

En comparación con ocho líneas base, que incluyen indicaciones de cadena de pensamiento, decodificación contrastiva visual y varios métodos de reasignación de atención y dirección de activación, TRACE logró la puntuación promedio más alta en todos los backbones, con ganancias totales de 2,84 a 3,18 puntos sobre la inferencia estándar en todo el conjunto de puntos de referencia.

El código del equipo está disponible en GitHub.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.