Aprendizaje por refuerzo
La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación
El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-30 · 3 min de lectura

El aprendizaje por refuerzo para modelos de lenguaje tiene un cuello de botella que cualquiera que haya depurado un modelo de recompensa conoce bien: la señal es demasiado débil. Una rúbrica evalúa una respuesta, comprime esa evaluación en un solo escalar y descarta todo lo demás sobre por qué una respuesta era mejor que otra. Dos respuestas con la misma puntuación pueden tener perfiles de calidad muy diferentes, pero el modelo nunca aprende la diferencia.
Un artículo de Microsoft Research Asia, publicado en arXiv esta semana, propone una solución que trata esa retroalimentación textual perdida como la señal principal en lugar de un desperdicio. El Aprendizaje Experimental (EL) reemplaza la recompensa escalar con lo que los autores llaman conocimiento experiencial: retroalimentación textual estructurada y transferible extraída por un modelo entrenador y luego destilada en los pesos del modelo de política durante el entrenamiento.
La idea central es simple: si ya tienes un modelo juez evaluando respuestas contra una rúbrica, ese juez posee información rica que nunca transmite. Los autores lo reutilizan como un entrenador que produce un breve análisis en lenguaje natural de cada respuesta: qué hizo bien, dónde se quedó corto y cómo sería una respuesta más sólida. Ese texto condiciona entonces un modelo maestro que genera respuestas de calidad de demostración. El modelo de política aprende de esas demostraciones mediante destilación de contexto en política, leyendo esencialmente la retroalimentación del entrenador y la respuesta mejorada del maestro mientras actualiza sus propios parámetros.

Este no es el mismo pipeline que el marco de Destilación de Habilidades en Política que cubrimos a principios de este año, aunque ambos comparten la intuición de que la retroalimentación más densa importa. OPID extrae supervisión retrospectiva de trayectorias completadas; EL la extrae del texto de evaluación del propio juez. Los dos podrían ser complementarios.
El artículo probó EL en dos familias de políticas, el Llama-3.1-8B-Instruct de código abierto y un modelo propietario, utilizando retroalimentación ya sea de la propia política o de GPT-4o como entrenador. En tareas abiertas no vistas y retenidas (el tipo donde existen rúbricas pero el espacio de respuestas es grande), EL superó consistentemente al RL estándar basado en rúbricas.
El resultado más interesante es lo que sucede fuera de la distribución de entrenamiento. El RL basado en rúbricas tiende a sobreadaptarse a los criterios de evaluación con los que fue entrenado; dado una rúbrica ligeramente diferente en el momento de la prueba, el rendimiento cae. Los modelos de EL se mantuvieron mejor, lo que sugiere que la retroalimentación textual enseñó una comprensión más general de la calidad en lugar de un mapeo mecánico de rúbrica a puntuación. Los autores también informan que EL mitigó el hackeo de recompensas, el fenómeno donde un modelo aprende a explotar lagunas en la función de recompensa en lugar de resolver la tarea.
Esto importa porque el hackeo de recompensas es un problema persistente en la alineación basada en RL. La solución de dos palabras para el problema de autosabotaje del aprendizaje por refuerzo que cubrimos recientemente abordó el problema desde un ángulo diferente, evitando que el proceso de optimización luche contra sí mismo. EL lo aborda desde el lado de los datos: si la señal de recompensa lleva más información, hay menos espacio para que el modelo descubra atajos frágiles.
La compensación es el cómputo. Ejecutar un modelo entrenador y un modelo maestro en cada respuesta en política añade al costo de entrenamiento. El artículo no reporta comparaciones de tiempo real, pero el pipeline claramente requiere más pases hacia adelante por paso de entrenamiento que un bucle RL estándar. La pregunta es si la mejora en generalización y robustez justifica el gasto adicional, y para cualquier equipo que entrene en tareas no verificables (escritura, razonamiento, diálogo abierto), la respuesta hasta ahora es sí.
Se promete código en el repositorio de Microsoft bajo el nombre del proyecto EL. Una vez lanzado, la verdadera prueba será si el método escala a modelos más grandes y se mantiene estable con diferentes modelos entrenadores. Por ahora, ofrece un camino concreto fuera de la trampa escalar que ha limitado el post-entrenamiento para tareas abiertas desde que RLHF se convirtió en estándar.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.