LLMs y Modelos3 min read
Aprendizaje por refuerzo
La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación
El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.
2026-07-30