SevenTnewS

Investigación en IA

Una auditoría revela que las afirmaciones de riesgo del RL distribucional son en su mayoría falsas

Una auditoría a gran escala muestra que los agentes de RL distribucional fabrican sistemáticamente compensaciones de riesgo en los mismos estados donde los profesionales más confiarían en ellos. En QR-DQN, C51 e IQN en MinAtar, ninguna de las afirmaciones más sólidas fue confirmable, y actuar según el consejo de CVaR de los agentes a veces tuvo un rendimiento significativamente peor que el azar.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-29 · 5 min de lectura

Una auditoría revela que las afirmaciones de riesgo del RL distribucional son en su mayoría falsas
Fuentes : Auditing the Ri…

El aprendizaje por refuerzo distribucional se ha convertido en un paradigma dominante en la IA moderna. Al reemplazar un único rendimiento esperado con una distribución de probabilidad completa sobre las recompensas futuras, estos métodos impulsaron algunos de los resultados más celebrados en agentes de juego y ahora fundamentan una creciente teoría de libros de texto. Pero un riguroso nuevo estudio del investigador Hari Prasad plantea una pregunta que pocos han medido directamente: cuando un agente distribucional entrenado informa que dos acciones difieren en riesgo, ¿es ese informe realmente cierto?

La respuesta, en siete combinaciones diferentes de algoritmo y juego, y miles de estados auditados, es que generalmente no lo es. El artículo, presentado como preprint y lanzado con un kit de herramientas de auditoría completo, proporciona lo que su autor llama “un diagnóstico que debe preceder a cualquier cura” para un defecto sospechado durante años pero nunca cuantificado a nivel de decisión.

La métrica de auditoría: aislando lo que importa

La contribución técnica central de Prasad es una métrica de auditoría llamada brecha de Wasserstein excedente, denotada como Δx(s). Para las dos acciones que el agente clasifica más altas por media en un estado dado, la métrica mide la distancia de Wasserstein-1 entre sus distribuciones de retorno menos la diferencia absoluta en sus medias. Cuando Δx(s) es cero, una acción domina estocásticamente a la otra en primer orden, cada funcional de riesgo monótono las clasifica de manera idéntica, y una política sensible al riesgo nunca se desviaría de una codiciosa por media. Cuando Δx(s) es positivo, el agente está afirmando una verdadera compensación de riesgo: ninguna acción es más segura en cada cuantil, y un usuario podría elegir racionalmente basándose en la aversión a la cola.

“La métrica aísla exactamente las afirmaciones que tienen contenido de decisión”, escribe Prasad. “Ignora los errores que ambas acciones comparten; la auditoría es de afirmaciones de riesgo relativas, del tipo sobre las que se actúa”.

Este cribado se combina con un andamiaje estadístico que incluye nulos de permutación, pruebas de refutación bootstrap y control de la tasa de falsos descubrimientos (FDR). Sin ese andamiaje, el artículo señala, la propia auditoría puede fabricar conclusiones falsas; se documentan y cuantifican dos trampas silenciosas de la evaluación basada en reinicios.

A través de tres algoritmos, la misma firma

Prasad entrenó agentes QR-DQN, C51 e IQN en tres juegos de MinAtar: Breakout, Seaquest y Asterix, con múltiples semillas por algoritmo para un total de 33 ejecuciones. Los resultados son sorprendentemente consistentes:

  • El 66-95% de las compensaciones de riesgo más fuertes afirmadas (el 2% superior de la propia clasificación Δx de cada agente) son refutadas con un 95% de confianza.
  • Esencialmente, ninguna afirmación es confirmable; cero de 735 estados de QR-DQN sobrevivieron a las pruebas corregidas por FDR en los tres juegos.
  • La correlación entre el exceso aprendido y el exceso real se mantuvo cerca de cero en todas las semillas y juegos (Pearson r ≈ 0.0).
  • La ubicación de las afirmaciones más seguras del agente es estadísticamente indistinguible de una mezcla aleatoria ciega a la verdad.

“Las cabezas colocan sus afirmaciones más sólidas no mejor que el azar ciego a la verdad”, concluye Prasad. El artefacto no es un síntoma de agentes subentrenados: aparece completamente formado a los 500,000 pasos de entrenamiento, crece con la misma fuerza de afirmación en la que un profesional clasificaría, no está correlacionado con la puntuación final, y se reproduce en un agente de Atari casi de última generación preentrenado.

Consecuencias a nivel de decisión: de beneficioso a antipredictivo

Para probar si la refutación teórica se traduce en daño práctico, Prasad comparó tres selectores de la acción más segura en los estados que los agentes señalaron como más críticos para el riesgo: la propia clasificación CVaR de la cabeza, una línea base codiciosa por media que ignora el riesgo, y la verdad fundamental. El resultado depende del entorno de una manera que no deja una regla confiable para los profesionales.

En Breakout, la cabeza QR-DQN fue genuinamente informativa, eligiendo la acción más segura el 81% de las veces frente al 44% de la codiciosa por media, con un arrepentimiento reducido de 1.36 a 0.20. En Seaquest, sin embargo, la cabeza fue antipredictiva: eligió la acción realmente más segura solo el 34% de las veces (por debajo del azar, p = 0.045), triplicando aproximadamente el arrepentimiento en relación con ignorar el riesgo por completo. En Asterix, fue un volado.

“Un profesional no puede saber qué régimen se obtiene”, escribe Prasad. “Un consejo que a veces es útil y a veces invertido es más difícil de usar que uno uniformemente no informativo”. C51 tuvo un rendimiento aún peor, siendo superado por la línea base codiciosa por media en los tres juegos.

Las reparaciones no logran restaurar afirmaciones de riesgo utilizables

El artículo prueba tres familias de reparaciones sugeridas por la literatura. Entrenar al agente para que sea codicioso por CVaR durante el aprendizaje (optimizando la cola) dejó sin cambios la sobreafirmación. Un conjunto de cinco miembros atenuó pero no calibró las afirmaciones principales. Y la recalibración a través de un mapa isotónico, que rescató perfectamente los controles positivos, pasó la auditoría solo colapsando las afirmaciones principales a ruido, afirmando cero compensaciones reales.

“La cabeza no está descalibrada, sino que es no informativa”, escribe Prasad. “Información faltante, no un error de escala reparable”. Un control de destilación confirmó que la arquitectura puede ajustar las distribuciones verdaderas cuando se supervisa directamente con objetivos de verdad fundamental, aislando el déficit al proceso de entrenamiento bootstrap en lugar de a la capacidad de la red.

Dos trampas que pueden engañar a los investigadores

El artículo documenta dos trampas metodológicas en la evaluación basada en reinicios que su autor encontró mientras desarrollaba la auditoría. La primera, la clonación de RNG, ocurre cuando la copia profunda de un entorno clona su generador aleatorio interno, haciendo que cada ejecución “aleatoria” reproduzca un futuro idéntico. El fallo es silencioso, direccionalmente plausible y sobrevive fácilmente a la revisión de código. La segunda, el piso de ruido empírico de Wasserstein, significa que incluso dos muestras de la misma distribución producen un exceso medido positivo que decae como n−1/2. Un umbral fijo ingenuo puede “confirmar” dos tercios de las afirmaciones que son puro ruido.

Ambas trampas produjeron auditorías convincentes pero incorrectas antes del diseño final. “La validación de afirmaciones distribucionales debe calibrarse contra un nulo por estado en el tamaño de muestra implementado”, advierte Prasad.

Lo que significa el hallazgo para el campo

Las cabezas de RL distribucional se utilizan cada vez más para tres propósitos prácticos: visualizar distribuciones de retorno para interpretar el comportamiento del agente, establecer umbrales para producir políticas sensibles al riesgo a través de CVaR y otros funcionales, y monitorearlas como señales de seguridad en la conducción autónoma y los pipelines de RL seguro. Los tres usos comparten la suposición de que donde la distribución aprendida de una acción difiere en forma de otra, el entorno realmente contiene esa estructura de riesgo.

“Las lecturas literales de las cabezas distribucionales son menos confiables en los estados donde es más probable que sean consultadas”, concluye Prasad, “y deben validarse contra la verdad fundamental antes de ser confiadas”.

Para el creciente cuerpo de trabajo que construye estimadores de incertidumbre, conjuntos y capas de calibración alrededor de cabezas distribucionales en bruto, la auditoría proporciona tanto un punto de referencia de medición como una línea base aleccionadora: una cabeza no informativa no da señal con la que trabajar a las correcciones posteriores. El artículo publica su kit de herramientas de auditoría completo y un estándar concreto para métodos futuros: una cabeza que pase la auditoría confirma sus afirmaciones principales.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.