SevenTnewS

Aprendizaje por Refuerzo

Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas

SVR-R1 convierte el propio veredicto binario de un modelo de lenguaje y visión en una señal de aprendizaje. Probado en puntos de referencia de razonamiento sobre gráficos y tablas, supera ampliamente al GRPO estándar, mientras que el modelo reduce progresivamente el número de rondas de verificación, lo que indica que internaliza la autocorrección.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-25 · 4 min de lectura

Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas
Fuentes : SVR-R1: Bootstr…

Cuando se les da una segunda oportunidad para pensar, los humanos suelen razonar para llegar a mejores respuestas. Un nuevo artículo de Meta y la Universidad de Illinois en Urbana-Champaign muestra que los modelos de lenguaje y visión pueden aprender a hacer lo mismo, verificando su propio trabajo y repensando cuando señalan una respuesta como incorrecta, todo dentro de un bucle de aprendizaje por refuerzo que no necesita jueces externos ni críticos auxiliares.

El marco, denominado Self-Verified Reasoner (SVR-R1), utiliza un esquema de entrenamiento RL de múltiples turnos basado en GRPO. Para cada consulta, el modelo produce una respuesta y, simultáneamente, emite un veredicto binario (Sí o No). Un "No" desencadena un replanteamiento de segunda oportunidad; un "Sí" (o alcanzar un límite de turnos) finaliza la salida, que luego recibe una recompensa basada en el resultado. Los mismos pesos del modelo sirven tanto como generador como verificador, y los tokens de verificación se enmascaran del cálculo de pérdida para evitar señales de optimización conflictivas.

Resultados que hablan por sí mismos

Evaluado en el subconjunto ChartQA (826 pares de preguntas y respuestas de prueba) y el subconjunto TableVQA (1250 preguntas basadas en tablas), SVR-R1 supera consistentemente a las líneas base de GRPO estándar tanto a escalas de 3 mil millones como de 7 mil millones de parámetros. En ChartQA, SVR-R1 con 3 mil millones logró un 83.3% de precisión en modo de ejecución pura (sin verificación en inferencia) frente al 80.5% de la línea base GRPO. Con la verificación final habilitada en la inferencia, SVR-R1 igualó ese 83.3% mientras que la línea base alcanzó el 80.9%. En TableVQA, SVR-R1 con 3 mil millones alcanzó un 72.4% (ejecución pura) y un 72.9% (con verificación), en comparación con el 68.3% y el 68.7% del GRPO.

Mejoras similares se mantienen a escala de 7 mil millones. En ChartQA, SVR-R1 alcanzó un 82.9% (ejecución pura y con verificación) frente al 80.4% y 81.1% del GRPO. En TableVQA, SVR-R1 obtuvo un 80.3% y 80.6% frente al 78.7% y 78.5% del GRPO. En el punto de referencia de razonamiento general ThinkLite-VL-70K, SVR-R1 superó a la mejor línea base de GRPO en MathVista (71.6% frente a 70.8%), MathVision (19.1% frente a 17.4%) y MMStar (49.3% frente a 48.7%), mientras que igualó en AI2D (81.4% frente a 81.5%).

Menos turnos de verificación, mayor confianza

La dinámica más interesante durante el entrenamiento es la caída constante en el número promedio de turnos de verificación. A medida que el modelo se entrena, se vuelve más seguro de sus respuestas iniciales y tiende a afirmarlas de inmediato, estabilizándose en aproximadamente un paso de generación seguido de un único Sí por parte del verificador. En las etapas posteriores del entrenamiento, SVR-R1 logra una precisión casi idéntica en entornos de ejecución pura y verificación final, lo que sugiere que el modelo ha internalizado la autocorrección y puede producir respuestas que reconoce como correctas sin necesidad de realizar realmente el replanteamiento en el momento de la inferencia.

Los autores atribuyen parte de esta ganancia a la capacidad del marco para finalizar respuestas de alta calidad a preguntas de dificultad media a través de múltiples rondas de despliegue. Replantearse repetidamente preguntas demasiado difíciles contribuye poco, ya que la respuesta correcta puede seguir siendo inalcanzable incluso con turnos de verificación ilimitados.

Implicaciones prácticas y preguntas abiertas

SVR-R1 aborda la intersección menos explorada del refinamiento automático en inferencia y el entrenamiento RL para modelos de lenguaje y visión. Al depender únicamente de la autoverificación binaria (Sí/No), el enfoque evita la necesidad de justificaciones detalladas o etiquetas de verdad fundamental externas, lo que lo hace escalable y eficiente en datos. Los investigadores planean publicar SVR-R1 como código abierto para permitir más trabajo en el razonamiento multimodal.

El artículo también plantea preguntas sobre cómo se pueden optimizar conjuntamente las capacidades de verificación y generación, especialmente a medida que mejoran las habilidades de autoverificación de los modelos de lenguaje y visión. Por ahora, SVR-R1 ofrece una receta simple para impulsar el razonamiento multimodal que no requiere más que la propia capacidad del modelo para decir Sí o No a su primer intento.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.