eficiencia de tokens
4 published articles
Escalado en tiempo de prueba
El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens
CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.
2026-08-19
Codificación con IA
OpenCode apuesta por la eficiencia de tokens y añade Ling 3.0 Flash gratis
OpenCode ahora ofrece el Ling 3.0 Flash de inclusionAI de forma gratuita, días después de su lanzamiento. La medida amplía una estrategia consciente de los costos que apuesta a que la eficiencia de tokens gana la carrera de la codificación con IA.
2026-08-07
Codificación con IA
El nuevo modelo Ling 3.0 Flash llega a OpenCode de forma gratuita
OpenCode ahora ofrece Ling 3.0 Flash de forma gratuita, un modelo eficiente en tokens de inclusionAI que podría hacer más barata la codificación con IA para los desarrolladores. La incorporación llega días después del lanzamiento del modelo.
2026-07-24
Modelos de IA
Google lanza Gemini 3.6 Flash junto con un modelo ligero y una variante de ciberseguridad
Los nuevos modelos Gemini de Google apuntan a agentes de IA de producción con mejor eficiencia de tokens y menor latencia. 3.6 Flash reduce el uso de tokens en un 17% frente a su predecesor. 3.5 Flash-Lite funciona a 350 tokens de salida por segundo. Una variante centrada en ciberseguridad se envía exclusivamente a socios verificados.
2026-07-22