SevenTnewS

Inferencia de LLM

4 published articles

IA5 min read

Escalado en tiempo de prueba

El enrutamiento de CoBa iguala la votación best-of-16 con un 58,9 % menos de tokens

CoBa, una política de enrutamiento equilibrado de cómputo de un nuevo artículo de arXiv, iguala la votación mayoritaria best-of-16 dentro de 0,01 puntos mientras reduce los tokens ponderados por parámetro en un 58,9 %. En 3.129 evaluaciones en MATH-500, AIME y AMC, también supera rotundamente a la decodificación de muestra única, aunque persiste una pequeña ventaja de best-of-16 cuando el presupuesto no es una limitación.

2026-08-19

IAFeatured3 min read

Recursos para desarrolladores

30 repositorios de GitHub que potencian el stack de IA, desde agentes hasta inferencia local

Un resumen práctico de 30 repositorios esenciales de GitHub para desarrolladores de IA, agrupados por caso de uso y clasificados por adopción comunitaria.

2026-07-30

LLMs y Modelos4 min read

Optimización de sistemas

DSpark demuestra por qué la inferencia rápida de IA es un problema de planificación, no un truco de modelo

El artículo de DSpark de DeepSeek revela que la decodificación especulativa ingenua degrada el rendimiento bajo alta concurrencia. Su solución, la verificación programada por confianza, adapta la longitud del bloque por solicitud y desplaza la frontera de Pareto del rendimiento del servicio.

2026-07-12

DeepSeek2 min read

Optimización de Inferencia de LLM

Aleph Alpha construye un modelo teórico de inferencia para descifrar el rendimiento de DeepSeek V3 a partir de primitivas de hardware

El modelo teórico de Aleph Alpha predice el rendimiento de inferencia de DeepSeek V3 únicamente a partir de parámetros de hardware, revelando cómo la cantidad de GPU y el ancho de banda de interconexión desplazan el cuello de botella entre cómputo, memoria y comunicación.

2026-07-04