aprendizaje por refuerzo
29 published articles
Fisher-R1 | Prueba de hipótesis
Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas
Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.
2026-08-19
Investigación
Tu modelo de IA que usa herramientas está dificultando las preguntas fáciles
Un nuevo artículo de KlingTeam mide cuándo los modelos multimodales realmente necesitan herramientas y cuándo estas perjudican. El modelo propuesto, Beacon, entrenado con recompensas sensibles a la necesidad, mejora tanto la precisión como la disciplina en el uso de herramientas.
2026-08-09
IA explicable
La perilla que nadie quería girar: dtControl2+ε permite sacrificar optimalidad por claridad
Una nueva extensión de dtControl2 permite a los ingenieros intercambiar una cantidad precisa de rendimiento por árboles de decisión más pequeños y comprensibles. La herramienta, dtControl2+ε, garantiza ε-optimalidad mientras poda árboles hasta órdenes de magnitud con menos nodos.
2026-08-05
Código abierto
OpenForgeRL entrena agentes de IA sin tocar sus arneses de inferencia
OpenForgeRL utiliza un proxy y Kubernetes para entrenar agentes de IA sin modificar sus arneses de inferencia. En las pruebas, OpenForgeGUI igualó a modelos varias veces más grandes en navegación web y puntos de referencia de escritorio.
2026-08-01
IA de investigación profunda
El nuevo agente de investigación de BAAI no solo busca más tiempo, sino que revisa su propia tarea
Los agentes AREX de BAAI utilizan un bucle de auto-mejora recursiva que comprime historiales de investigación largos, permitiendo un refinamiento eficiente impulsado por la verificación. Entrenados con una novedosa receta de RL de horizonte largo, superan a las líneas base comparables en BrowseComp, DeepSearchQA y HLE.
2026-07-31
Aprendizaje por refuerzo
La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación
El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.
2026-07-30
Investigación
El RL explicable aborda el control de tráfico aéreo, un mapa de saliencia a la vez
Un equipo de investigadores aplica RL explicable al control del tráfico aéreo, entrenando un agente para evitar zonas de exclusión aérea y usando mapas de saliencia para revelar su razonamiento. El trabajo es un paso preliminar hacia la confianza en la IA de alto riesgo.
2026-07-27
Investigación
La memoria compartida tiene doble filo: escalar algoritmos actor-crítico más allá de cinco agentes muestra rendimientos decrecientes
Investigadores compartieron búferes de reproducción entre agentes actor-crítico en tareas de acciones parametrizadas. GAC saltó en rendimiento, pero SAC y TQC solo avanzaron lentamente. Más allá de cinco agentes, el costo computacional se dispara sin un retorno significativo. El artículo ofrece un límite práctico sobre hasta dónde pueden estirarse los métodos de experiencia compartida antes de estancarse.
2026-07-27
Investigación en BCI
El aprendizaje por refuerzo mejora en un 41% la decodificación de interfaces cerebro-computadora
Los investigadores proponen CNN-LSTM-RL, un marco de dos etapas que aplica aprendizaje por refuerzo para corregir errores sistemáticos en decodificadores de interfaces cerebro-computadora no invasivas. Sin necesidad de datos neuronales adicionales, el método mejoró la correlación de decodificación de movimiento 3D en un 41,5% y redujo el error cuadrático medio en un 40,2% en diez participantes.
2026-07-27
Aprendizaje por Refuerzo
Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas
SVR-R1 convierte el propio veredicto binario de un modelo de lenguaje y visión en una señal de aprendizaje. Probado en puntos de referencia de razonamiento sobre gráficos y tablas, supera ampliamente al GRPO estándar, mientras que el modelo reduce progresivamente el número de rondas de verificación, lo que indica que internaliza la autocorrección.
2026-07-25
Inteligencia Artificial
Modelos más pequeños que dudan de sí mismos pueden superar a otros 10 veces más grandes
RefineRL entrena modelos de lenguaje pequeños para refinar iterativamente sus propias soluciones de programación competitiva mediante un agente escéptico y aprendizaje por refuerzo. Un modelo de 4B que usa este método supera a modelos de 32B y se acerca al rendimiento de 235B, lo que sugiere que el auto-refinamiento, no el tamaño bruto, puede ser una ruta de escalado más sólida para tareas de razonamiento.
2026-07-25
Investigación
La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva
SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.
2026-07-25