IA4 min read
Aprendizaje por Refuerzo
Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas
SVR-R1 convierte el propio veredicto binario de un modelo de lenguaje y visión en una señal de aprendizaje. Probado en puntos de referencia de razonamiento sobre gráficos y tablas, supera ampliamente al GRPO estándar, mientras que el modelo reduce progresivamente el número de rondas de verificación, lo que indica que internaliza la autocorrección.
2026-07-25