SevenTnewS

Escalado en tiempo de prueba

El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens

CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-19 · 5 min de lectura

El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens

El escalado en tiempo de prueba tiene una forma predeterminada: gastar más cómputo de inferencia y confiar en que la respuesta mejore. Muestrear más soluciones, ampliar la traza de razonamiento o incorporar un evaluador más fuerte. Un artículo enviado a arXiv el 7 de agosto de 2026 sostiene que esas tres palancas compiten entre sí, y que la pregunta interesante no es cuánto cómputo gasta un sistema, sino cómo decide a dónde va la siguiente unidad. La respuesta propuesta es CoBa, una política de enrutamiento equilibrado de cómputo, y su resultado principal es contundente: precisión equivalente a aproximadamente la mitad del costo en tokens.

El artículo, titulado «CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing», reformula el razonamiento en tiempo de prueba como un problema de asignación de cómputo. En cada paso, el sistema debe elegir entre generación, verificación o detención. Las estrategias existentes tienden a comprometerse con un eje e inyectar cómputo en una sola fase. CoBa parte de la observación opuesta: bajo un presupuesto fijo, gastar en un eje priva a los demás.

Por qué el escalado de un solo eje está chocando contra un muro

CoBa no es el único trabajo reciente que cuestiona la lógica de gastar más. ThinkRetrieve, un artículo complementario de arXiv del 11 de agosto de 2026, informa que el escalado secuencial en tiempo de prueba a menudo produce rendimientos decrecientes o incluso negativos, ya que las trazas de razonamiento más largas acumulan incertidumbre, agravan los errores y se desvían del problema original. En ese mismo período, «The Verification Horizon» sostiene que para los agentes de codificación la vieja suposición de que verificar es más fácil que producir se ha invertido: comprobar de forma fiable un candidato es ahora el problema más difícil, y cada verificador es solo un proxy de la intención humana.

Ambos artículos apuntan hacia la premisa de CoBa: las ganancias de una asignación más inteligente pueden superar las ganancias de más cómputo. PoTRE, un framework de julio de 2026, logra un mejor rendimiento de razonamiento con tokens de inferencia similares o menores que los de los baselines homogéneos fuertemente escalados. Penelope, presentado el 28 de julio de 2026, localiza el cómputo recurrente para evitar trazas de razonamiento visibles y largas. El mismo cambio es visible en el lado de la inferencia, donde trabajos como DSpark tratan la aceleración como un problema de planificación y asignación de recursos en lugar de una pura optimización de modelos. El campo converge hacia la asignación por encima de la fuerza bruta.

Cómo CoBa enruta el cómputo

CoBa funciona en dos niveles. Primero genera un pequeño conjunto de candidatos, aplica una verificación barata de forma amplia a todos ellos y luego enruta los candidatos inciertos o de alto valor hacia una verificación más fuerte. Los verificadores débiles filtran los fallos evidentes a bajo costo; la verificación fuerte se gasta solo donde puede cambiar el resultado.

El sistema fue evaluado en 3.129 evaluaciones de generador de ejemplos que abarcan MATH-500, AIME 2024 y 2025, AMC 2023 y razonamiento simbólico procedimental. Estos benchmarks cubren matemáticas de competición y tareas simbólicas estructuradas, el terreno donde normalmente se prueban las afirmaciones sobre el escalado en tiempo de prueba.

Los números de eficiencia que importan

CoBa-Routed-Strong alcanza un 85,13 % de precisión macro, igualando estadísticamente un proxy de votación ponderada por autoevaluación con un 85,20 % mientras usa un 49,1 % menos de tokens ponderados por parámetro. Frente a la fuerza bruta, el resultado es más contundente: iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos de precisión macro mientras usa un 58,9 % menos de tokens ponderados por parámetro, aunque las pruebas pareadas mantienen una pequeña ventaja para best-of-16 a un costo sustancialmente mayor.

Los tokens ponderados por parámetro contabilizan el trabajo de cada token según el tamaño del modelo que lo produjo, de modo que la comparación cubre a la vez la longitud de la salida y la escala del modelo. Vale la pena hacer la aritmética: un 58,9 % menos de tokens significa que CoBa se ejecuta a aproximadamente el 41 % del costo de best-of-16, es decir, unas 2,4 veces más barato. El proxy de autoevaluación consume casi el doble del presupuesto de CoBa.

Las pruebas bootstrap pareadas confirman ganancias significativas sobre la decodificación de muestra única. CoBa no solo ahorra tokens mientras mantiene la calidad; supera al baseline más barato e iguala a los caros.

CoBa-Routed-Strong frente a los baselines en matemáticas y razonamiento simbólico
MétodoPrecisión macroCosto frente a CoBa
CoBa-Routed-Strong85,13 %referencia
Proxy de votación ponderada por autoevaluación85,20 %~2x los tokens de CoBa
Votación mayoritaria best-of-16dentro de 0,01 pts de CoBa~2,4x los tokens de CoBa
Decodificación de muestra únicasignificativamente menor (pruebas pareadas)el más bajo
Oráculo del poolmayor; no alcanzadocota superior

Dónde CoBa todavía se queda corto

El artículo es explícito sobre los límites. Best-of-16 conserva una ventaja pequeña pero significativa en las pruebas pareadas: cuando cada punto de precisión importa y el presupuesto existe, la votación por fuerza bruta todavía se adelanta. Y el oráculo del pool, que siempre elige al mejor candidato sobre la mesa, sigue fuera de alcance. La brecha con el oráculo se describe como margen para un enrutamiento más preciso, que es otra forma de decir que el nivel de verificación barata todavía clasifica mal a candidatos que una pasada más fuerte habría detectado.

Los resultados también descansan sobre una familia específica de benchmarks. Las matemáticas de competición y el razonamiento simbólico premian respuestas verificables y bien delimitadas. Si la misma economía de enrutamiento se sostiene en tareas agénticas abiertas o creativas no queda establecido en este artículo.

Qué significa para los sistemas locales y con presupuesto limitado

El artículo cierra con la implicación que más importa para el despliegue en el dispositivo y con restricciones de costo: para los sistemas de razonamiento locales, el escalado en tiempo de prueba se convierte en una cuestión de dónde es más valioso el siguiente cómputo. Cuando cada token tiene un precio, una política que enruta en lugar de muestrear no es una conveniencia. Es la diferencia entre una técnica que cabe en el presupuesto y una que no.

Ese marco también expone el supuesto en el que se apoya CoBa: la verificación barata detecta la mayoría de los fallos. La advertencia del artículo The Verification Horizon también aplica aquí. Las políticas de enrutamiento reducen el costo de la verificación, pero no el hecho de que un verificador sea un proxy. La ganancia de eficiencia es real. El riesgo epistémico no desaparece.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.