razonamiento multimodal
2 published articles
Aprendizaje por Refuerzo
Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas
SVR-R1 convierte el propio veredicto binario de un modelo de lenguaje y visión en una señal de aprendizaje. Probado en puntos de referencia de razonamiento sobre gráficos y tablas, supera ampliamente al GRPO estándar, mientras que el modelo reduce progresivamente el número de rondas de verificación, lo que indica que internaliza la autocorrección.
2026-07-25
IA multimodal
Por qué los modelos de visión-lenguaje necesitan una ventana de retransmisión visual para dejar de alucinar
Una nueva investigación revela una redistribución estable de tres etapas de la atención multimodal en los VLM, operacionalizada como la Ventana de Retransmisión Visual (VRW). El marco TRACE utiliza módulos ligeros entrenados para programar esta ventana por tarea, mejorando los puntos de referencia sensibles al anclaje en un promedio de 4,33 puntos y hasta 6,6 puntos.
2026-07-23