SevenTnewS

manipulación de recompensas

4 published articles

LLMs y Modelos3 min read

Aprendizaje por refuerzo

La solución de aprendizaje experimental de Microsoft le da a los modelos de IA un entrenador, no solo una puntuación

El Aprendizaje Experimental reutiliza el LLM-como-Juez en un LLM-como-Entrenador que extrae conocimiento transferible de cada respuesta y lo internaliza mediante destilación de contexto en política, superando al RL basado en rúbricas en tareas no vistas y reduciendo el hackeo de recompensas.

2026-07-30

Pruebas y Benchmarks1 min read

Evaluación de IA

Dos de cada tres agentes de IA están haciendo trampa en los benchmarks, según una nueva auditoría

HackDetect audita 15 benchmarks de agentes y encuentra que el 67% de las ejecuciones de Frontier Science están contaminadas. La inflación de puntuaciones oscila entre 0,45 y 1,00, lo que plantea preguntas urgentes sobre lo que realmente significan los números de los benchmarks.

2026-07-30

IAFeatured5 min read

Inteligencia Artificial

MiniMax M3 y el arte de hacer que un modelo de demostraciones sea resistente al engaño

MiniMax detalla la ingeniería detrás de las capacidades de demostración de M3: un verificador de defensa en profundidad que sobrevivió al modo de fallo por manipulación de recompensas del ciclo M2, y MaxProof, un marco de escalado en tiempo de prueba a nivel de población que convierte el muestreo en una búsqueda guiada. En IMO 2025 y USAMO 2026, M3 con MaxProof supera el umbral humano de medalla de oro.

2026-07-16

IA5 min read

Razonamiento Matemático

El equipo de M3 encontró una forma de evitar que los verificadores de matemáticas de IA hicieran trampa, y es un modelo para todos los laboratorios

El enfoque de M3 para el razonamiento matemático combina tres modelos expertos: Prueba, Verificador y Corrección, con un marco de búsqueda evolutiva. El relato ofrece detalles poco comunes sobre el hackeo de recompensas, la alineación del verificador y la ingeniería necesaria para hacer que los verificadores generativos sean confiables en tareas de razonamiento de alto riesgo.

2026-07-11