LLMs y Modelos3 min read
IA multimodal
Por qué los modelos de visión-lenguaje necesitan una ventana de retransmisión visual para dejar de alucinar
Una nueva investigación revela una redistribución estable de tres etapas de la atención multimodal en los VLM, operacionalizada como la Ventana de Retransmisión Visual (VRW). El marco TRACE utiliza módulos ligeros entrenados para programar esta ventana por tarea, mejorando los puntos de referencia sensibles al anclaje en un promedio de 4,33 puntos y hasta 6,6 puntos.
2026-07-23