SevenTnewS

aprendizaje por refuerzo

29 published articles

Laboratorios e Investigación3 min read

Fisher-R1 | Prueba de hipótesis

Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas

Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.

2026-08-19

LLMs y Modelos3 min read

Investigación

Tu modelo de IA que usa herramientas está dificultando las preguntas fáciles

Un nuevo artículo de KlingTeam mide cuándo los modelos multimodales realmente necesitan herramientas y cuándo estas perjudican. El modelo propuesto, Beacon, entrenado con recompensas sensibles a la necesidad, mejora tanto la precisión como la disciplina en el uso de herramientas.

2026-08-09

IA3 min read

IA explicable

La perilla que nadie quería girar: dtControl2+ε permite sacrificar optimalidad por claridad

Una nueva extensión de dtControl2 permite a los ingenieros intercambiar una cantidad precisa de rendimiento por árboles de decisión más pequeños y comprensibles. La herramienta, dtControl2+ε, garantiza ε-optimalidad mientras poda árboles hasta órdenes de magnitud con menos nodos.

2026-08-05

Código Abierto2 min read

Código abierto

OpenForgeRL entrena agentes de IA sin tocar sus arneses de inferencia

OpenForgeRL utiliza un proxy y Kubernetes para entrenar agentes de IA sin modificar sus arneses de inferencia. En las pruebas, OpenForgeGUI igualó a modelos varias veces más grandes en navegación web y puntos de referencia de escritorio.

2026-08-01

Agentes de IA3 min read

IA de investigación profunda

El nuevo agente de investigación de BAAI no solo busca más tiempo, sino que revisa su propia tarea

Los agentes AREX de BAAI utilizan un bucle de auto-mejora recursiva que comprime historiales de investigación largos, permitiendo un refinamiento eficiente impulsado por la verificación. Entrenados con una novedosa receta de RL de horizonte largo, superan a las líneas base comparables en BrowseComp, DeepSearchQA y HLE.

2026-07-31

LLMs y Modelos3 min read

Aprendizaje por refuerzo

La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación

El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.

2026-07-30

Laboratorios e InvestigaciónFeatured1 min read

Investigación

El RL explicable aborda el control de tráfico aéreo, un mapa de saliencia a la vez

Un equipo de investigadores aplica RL explicable al control del tráfico aéreo, entrenando un agente para evitar zonas de exclusión aérea y usando mapas de saliencia para revelar su razonamiento. El trabajo es un paso preliminar hacia la confianza en la IA de alto riesgo.

2026-07-27

PLN y ML3 min read

Investigación

La memoria compartida tiene doble filo: escalar algoritmos actor-crítico más allá de cinco agentes muestra rendimientos decrecientes

Investigadores compartieron búferes de reproducción entre agentes actor-crítico en tareas de acciones parametrizadas. GAC saltó en rendimiento, pero SAC y TQC solo avanzaron lentamente. Más allá de cinco agentes, el costo computacional se dispara sin un retorno significativo. El artículo ofrece un límite práctico sobre hasta dónde pueden estirarse los métodos de experiencia compartida antes de estancarse.

2026-07-27

IA4 min read

Investigación en BCI

El aprendizaje por refuerzo mejora en un 41% la decodificación de interfaces cerebro-computadora

Los investigadores proponen CNN-LSTM-RL, un marco de dos etapas que aplica aprendizaje por refuerzo para corregir errores sistemáticos en decodificadores de interfaces cerebro-computadora no invasivas. Sin necesidad de datos neuronales adicionales, el método mejoró la correlación de decodificación de movimiento 3D en un 41,5% y redujo el error cuadrático medio en un 40,2% en diez participantes.

2026-07-27

IA3 min read

Aprendizaje por Refuerzo

Investigadores de Meta y UIUC entrenan modelos de lenguaje y visión para que verifiquen su propio trabajo y repiensen respuestas incorrectas

SVR-R1 convierte el propio veredicto binario de un modelo de lenguaje y visión en una señal de aprendizaje. Probado en puntos de referencia de razonamiento sobre gráficos y tablas, supera ampliamente al GRPO estándar, mientras que el modelo reduce progresivamente el número de rondas de verificación, lo que indica que internaliza la autocorrección.

2026-07-25

IAFeatured3 min read

Inteligencia Artificial

Modelos más pequeños que dudan de sí mismos pueden superar a otros 10 veces más grandes

RefineRL entrena modelos de lenguaje pequeños para refinar iterativamente sus propias soluciones de programación competitiva mediante un agente escéptico y aprendizaje por refuerzo. Un modelo de 4B que usa este método supera a modelos de 32B y se acerca al rendimiento de 235B, lo que sugiere que el auto-refinamiento, no el tamaño bruto, puede ser una ruta de escalado más sólida para tareas de razonamiento.

2026-07-25

LLMs y ModelosFeatured4 min read

Investigación

La brecha de supervisión en RL agéntico acaba de recibir una solución gracias a la retrospectiva

SEED (Destilación Autoevolutiva en Política) permite que un LLM analice sus propias trayectorias pasadas, extraiga habilidades retrospectivas reutilizables en lenguaje natural y luego destile esas lecciones de vuelta a su política durante el RL. El resultado: una supervisión más densa y en política que mejora la eficiencia de muestreo y se generaliza a tareas no vistas.

2026-07-25

← PreviousPage 1 / 3 · 29 articlesNext →