modelos de razonamiento
6 published articles
Escalado en tiempo de prueba
El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens
CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.
2026-08-19
Investigación en IA
Las cadenas de pensamiento más largas chocan contra un muro. ThinkRetrieve inyecta la solución a mitad del razonamiento
El escalado secuencial en tiempo de prueba suele toparse con rendimientos decrecientes o incluso negativos, sostiene un nuevo preprint. ThinkRetrieve recupera ejemplos resueltos a mitad del razonamiento y los inyecta en la traza, con ganancias relativas de hasta el 60% en AIME 2025 en cinco modelos pequeños de razonamiento.
2026-08-18
Investigación en IA
Por qué la probabilidad logarítmica de los tokens es la señal equivocada para monitorear modelos de razonamiento de IA
Novelis Research demuestra que la probabilidad logarítmica de los tokens falla como monitor de decodificador para modelos de razonamiento cuantizados, siendo ciega a los bucles confiados. Introducen un controlador e-CUSUM calibrado que combina señales de incertidumbre y repetición, logrando selectividad en GSM8K con DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
Inteligencia Artificial
Por qué la cadena de pensamiento de tu IA está desperdiciando tokens y cómo el parada óptima lo soluciona
Investigadores del MIT proponen OS-Pruner, un complemento que detiene dinámicamente el razonamiento de cadena de pensamiento cuando una mayor computación no vale el costo de tokens. Las pruebas muestran una reducción de longitud del 20 al 60% con un sacrificio mínimo de precisión.
2026-07-29
Análisis profundo de benchmarks
ARC-AGI-2: El benchmark que mide la inteligencia fluida en sistemas de IA
ARC-AGI-2 prueba la inteligencia fluida de los sistemas de IA mediante rompecabezas en cuadrículas visuales que no pueden resolverse por memorización. Los modelos frontera actuales puntúan entre 75 y 85%, pero el gran premio de 700.000 dólares sigue sin reclamarse. Aquí un análisis profundo del diseño del benchmark, la puntuación y la tabla de clasificación actual.
2026-07-01
Investigación en seguridad de IA
Los modelos de IA no pueden dejar de pensar en voz alta. Eso es tanto una buena noticia como una pesadilla para la seguridad.
Claude Sonnet 4.5 puede controlar su cadena de pensamiento solo el 2.7% del tiempo, frente al 61.9% para los resultados finales. La brecha plantea preguntas abiertas sobre la solidez de la monitorización de CoT como mecanismo de seguridad, y nadie sabe por qué existe.
2026-03-09