SevenTnewS

escalado en tiempo de prueba

4 published articles

IA5 min read

Escalado en tiempo de prueba

El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens

CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.

2026-08-19

Laboratorios e Investigación4 min read

Investigación en IA

Las cadenas de pensamiento más largas chocan contra un muro. ThinkRetrieve inyecta la solución a mitad del razonamiento

El escalado secuencial en tiempo de prueba suele toparse con rendimientos decrecientes o incluso negativos, sostiene un nuevo preprint. ThinkRetrieve recupera ejemplos resueltos a mitad del razonamiento y los inyecta en la traza, con ganancias relativas de hasta el 60% en AIME 2025 en cinco modelos pequeños de razonamiento.

2026-08-18

Herramientas y Frameworks3 min read

Investigación en IA

La evolución de harness se ve impresionante hasta que la pruebas en tareas no vistas

Se espera que la evolución automática de harness haga mejores a los agentes LLM, pero un nuevo artículo argumenta que muchas de las mejoras reportadas pueden deberse a sobreajuste al conjunto de prueba público. En experimentos, métodos simples de escalado en tiempo de prueba igualaron o superaron a la evolución, y los harness evolucionados mostraron una generalización limitada a tareas no vistas.

2026-07-27

IAFeatured5 min read

Inteligencia Artificial

MiniMax M3 y el arte de hacer que un modelo de demostraciones sea resistente al engaño

MiniMax detalla la ingeniería detrás de las capacidades de demostración de M3: un verificador de defensa en profundidad que sobrevivió al modo de fallo por manipulación de recompensas del ciclo M2, y MaxProof, un marco de escalado en tiempo de prueba a nivel de población que convierte el muestreo en una búsqueda guiada. En IMO 2025 y USAMO 2026, M3 con MaxProof supera el umbral humano de medalla de oro.

2026-07-16