Inférence LLM
4 published articles
Scaling au moment du test
Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins
CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.
2026-08-19
Ressources pour développeurs
30 dépôts GitHub qui alimentent la pile IA, des agents à l'inférence locale
Un aperçu pratique de 30 dépôts GitHub essentiels pour les développeurs IA, regroupés par cas d'usage et classés par adoption communautaire.
2026-07-30
Optimisation des systèmes
DSpark montre que l’inférence rapide de l’IA est un problème d’ordonnancement, pas un tour de modèle
L’article de DSpark de DeepSeek révèle que le décodage spéculatif naïf dégrade le débit en situation de forte concurrence. Sa solution, la vérification à ordonnancement par confiance, adapte la longueur des blocs par requête et déplace la frontière de Pareto des performances de service.
2026-07-12
Optimisation de l'inférence LLM
Aleph Alpha construit un modèle d'inférence théorique pour décoder les performances de DeepSeek V3 à partir de primitives matérielles
Le modèle théorique d'Aleph Alpha prédit les performances d'inférence de DeepSeek V3 à partir des seuls paramètres matériels, révélant comment le nombre de GPU et la bande passante d'interconnexion déplacent le goulot d'étranglement entre le calcul, la mémoire et la communication.
2026-07-04