Investigación en IA
La solución de dos palabras para el problema de autosabotaje del aprendizaje por refuerzo
El aprendizaje por refuerzo multitarea tiene un secreto: las señales de recompensa que impulsan la alineación a menudo trabajan en contra. Un equipo internacional acaba de publicar un método que evita que el sistema se enfrente a sí mismo, y cuesta casi nada añadirlo a los procesos existentes.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-19 · 4 min de lectura

El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF) se ha convertido en la forma estándar de alinear grandes modelos de lenguaje con las preferencias humanas. Pero a medida que los modelos se entrenan en un conjunto cada vez más amplio de objetivos, seguimiento de instrucciones, estilo de escritura, precisión factual, corrección del código, , las señales de recompensa que impulsan el aprendizaje se vuelven desordenadas y a menudo contradictorias. Un nuevo artículo de un equipo de investigación internacional propone una solución que aborda directamente estas inestabilidades. El horizonte de verificación: por qué verificar agentes…
El problema de múltiples recompensas
En el aprendizaje por refuerzo multitarea, cada indicación produce su propio vector de recompensa, combinando juicios binarios (¿siguió el modelo la instrucción?), puntuaciones fraccionarias (¿qué tan gramatical es la salida?) y métricas continuas (similitud de incrustaciones). Estas recompensas a menudo operan en escalas y distribuciones muy diferentes. Peor aún, las dimensiones de recompensa pueden estar correlacionadas: un modelo que escribe bien también puede obtener una puntuación más alta en el seguimiento de instrucciones simplemente porque un lenguaje coherente se alinea con la finalización de la tarea. Los métodos estándar de estimación de ventaja, que calculan un único escalar a partir de sumas ponderadas, amplifican el ruido tanto de la heterocedasticidad como de la redundancia. OPID brinda a los agentes de lenguaje una señal de…
"La dificultad central es que una escalarización ingenua de las recompensas antes del cálculo de la ventaja produce actualizaciones de gradiente inestables", escriben los autores. "Esto es especialmente agudo cuando la distribución de recompensas cambia entre indicaciones y etapas de entrenamiento".
Los investigadores identifican dos modos de fallo: disparidad de magnitud (una recompensa fraccionaria que va de 0 a 1 emparejada con una recompensa continua que va de 0 a 100) y redundancia de correlación (dos dimensiones de recompensa que codifican información superpuesta, lo que lleva a pasos de gradiente demasiado confiados).
Arquitectura de dos etapas de RDPO
Reward-Decorrelated Policy Optimization aborda ambos problemas en secuencia. La primera etapa aplica una normalización de cuantiles consciente de la magnitud (MAQ), que ordena todas las recompensas para una dimensión dada en todo el lote, las ancla en su mediana y las escala por el rango intercuartílico. A diferencia de la normalización de cuantiles estándar, MAQ preserva la información de magnitud al rastrear la mediana como un parámetro aprendido, lo que permite al modelo distinguir entre una recompensa consistentemente alta y una que es esporádicamente alta.
La segunda etapa aplica un blanqueamiento de Mahalanobis dentro de cada subespacio de recompensa activo. Los investigadores agrupan las dimensiones de recompensa que están activas para una indicación dada (un subconjunto apropiado para la tarea del vector de recompensa completo) y calculan la distancia de Mahalanobis, lo que efectivamente descorrelaciona las dimensiones antes de agregarlas en una ventaja escalar. Esto evita que las señales redundantes se cuenten dos veces en la actualización del gradiente.
"El paso de Mahalanobis es crucial porque actúa como una corrección por lote", explican los autores. "Las correlaciones de recompensa no son estáticas; cambian a medida que la política del modelo evoluciona. La descorrelación en línea captura esta dinámica".
Resultados en LongCat-Flash
Los investigadores integraron RDPO en el proceso de post-entrenamiento de LongCat-Flash, un modelo existente de contexto largo. En comparación con la estimación de ventaja estándar, RDPO mejoró el seguimiento de instrucciones en 8.3 puntos porcentuales en el subconjunto de seguimiento de instrucciones de MT-Bench, aumentó las puntuaciones de calidad de escritura en 6.1 puntos en un conjunto de evaluación de escritura propietario, y redujo la sensibilidad a variantes de indicaciones difíciles en un 12% en pruebas adversariales. En puntos de referencia estándar de razonamiento (GSM8K, MATH) y evaluaciones de codificación (HumanEval, MBPP), el rendimiento se mantuvo dentro del ruido estadístico de la línea base, sin degradación del paso de descorrelación. Ifbench: el nuevo benchmark que evalúa el seguimiento…
Un estudio de ablación mostró que MAQ y el blanqueamiento de Mahalanobis son beneficiosos individualmente: MAQ por sí solo recuperó el 60% de la ganancia total, y el paso de blanqueamiento añadió el resto. Eliminar ambos redujo el rendimiento a la línea base original.
Implicaciones más amplias
El artículo llega en un momento en que los procesos de RLHF enfrentan un escrutinio creciente, con debates sobre el hacking de recompensas, el colapso del modelo de recompensa y la fragilidad de la optimización multiobjetivo. RDPO ofrece un complemento relativamente ligero: no requiere reentrenar el modelo de recompensa, solo modificar el cálculo de ventaja, lo que lo hace viable para los procesos de RLHF existentes. how-local-llms-like-gemma-and-qwen-are-taming-open-source-repository-triage-at-scale
"La belleza del enfoque es que trata el procesamiento de recompensas como un problema de optimización de primera clase, no solo como un paso de preprocesamiento", dice la Dra. Sarah Chen, investigadora de aprendizaje por refuerzo no afiliada al estudio. "Muchos laboratorios simplemente normalizan las recompensas a media cero, varianza unitaria, y esperan lo mejor. RDPO está diseñado explícitamente para los dos casos más difíciles".
Lo que queda sin resolver
El artículo no aborda la precisión del modelo de recompensa en sí; RDPO solo mejora el consumo de recompensas, no la calidad de la señal de recompensa. Si el modelo de recompensa está sesgado o desalineado, descorrelacionado o no, la política seguirá optimizando para el objetivo equivocado. También está la sobrecarga computacional de calcular matrices de covarianza por lote, que crece cuadráticamente con el número de dimensiones de recompensa activas y podría convertirse en un cuello de botella en espacios de muy alta dimensionalidad. MiniMax M3 rompe el techo de peso abierto con una…
Los autores reconocen que su método asume que las dimensiones de recompensa pueden dividirse razonablemente en subespacios activos, una elección de diseño que puede no ser sencilla para tareas con objetivos profundamente entrelazados.
"Vemos a RDPO como una base para un RL multirecompensa más fundamentado, no como una solución final", concluyen. "Entender cuándo las recompensas deben descorrelacionarse y cuándo deben mantenerse acopladas es una dirección de investigación abierta".
- Fuente : How to stop reinforcement learning from collapsing under its own rewards — 2026-05-18
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.