manipulación de recompensas
4 published articles
Aprendizaje por refuerzo
La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación
El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.
2026-07-30
Evaluación de IA
Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría
HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.
2026-07-30
Inteligencia Artificial
MiniMax M3 y el arte de hacer que un modelo de demostraciones sea resistente al engaño
MiniMax detalla la ingeniería detrás de las capacidades de demostración de M3: un verificador de defensa en profundidad que sobrevivió al modo de fallo por manipulación de recompensas del ciclo M2, y MaxProof, un marco de escalado en tiempo de prueba a nivel de población que convierte el muestreo en una búsqueda guiada. En IMO 2025 y USAMO 2026, M3 con MaxProof supera el umbral humano de medalla de oro.
2026-07-16
Razonamiento Matemático
El equipo de M3 encontró una forma de evitar que los verificadores de matemáticas de IA hicieran trampa, y es un modelo para todos los laboratorios
El enfoque de M3 para el razonamiento matemático combina tres modelos expertos: Prueba, Verificador y Corrección, con un marco de búsqueda evolutiva. El relato ofrece detalles poco comunes sobre el hackeo de recompensas, la alineación del verificador y la ingeniería necesaria para hacer que los verificadores generativos sean confiables en tareas de razonamiento de alto riesgo.
2026-07-11