Inferencia de LLM
4 published articles
Escalado en tiempo de prueba
El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens
CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.
2026-08-19
Recursos para desarrolladores
30 repositorios de GitHub que potencian el stack de IA, desde agentes hasta inferencia local
Un resumen práctico de 30 repositorios esenciales de GitHub para desarrolladores de IA, agrupados por caso de uso y clasificados por adopción comunitaria.
2026-07-30
Optimización de sistemas
DSpark demuestra por qué la inferencia rápida de IA es un problema de planificación, no un truco de modelo
El artículo de DSpark de DeepSeek revela que la decodificación especulativa ingenua degrada el rendimiento bajo alta concurrencia. Su solución, la verificación programada por confianza, adapta la longitud del bloque por solicitud y desplaza la frontera de Pareto del rendimiento del servicio.
2026-07-12
Optimización de Inferencia de LLM
Aleph Alpha construye un modelo teórico de inferencia para descifrar el rendimiento de DeepSeek V3 a partir de primitivas de hardware
El modelo teórico de Aleph Alpha predice el rendimiento de inferencia de DeepSeek V3 únicamente a partir de parámetros de hardware, revelando cómo la cantidad de GPU y el ancho de banda de interconexión desplazan el cuello de botella entre cómputo, memoria y comunicación.
2026-07-04