SevenTnewS

Inférence LLM

4 published articles

IA5 min read

Scaling au moment du test

Le routage CoBa égalise le vote majoritaire best-of-16 avec 58,9 % de jetons en moins

CoBa, une politique de routage à calcul équilibré issue d'un nouvel article arXiv, égalise le vote majoritaire best-of-16 à moins de 0,01 point près tout en réduisant de 58,9 % les jetons pondérés par paramètres. Sur 3 129 évaluations couvrant MATH-500, AIME et AMC, elle bat également nettement le décodage à échantillon unique, même si un léger avantage du best-of-16 subsiste lorsque le budget n'est pas une contrainte.

2026-08-19

IAFeatured3 min read

Ressources pour développeurs

30 dépôts GitHub qui alimentent la pile IA, des agents à l'inférence locale

Un aperçu pratique de 30 dépôts GitHub essentiels pour les développeurs IA, regroupés par cas d'usage et classés par adoption communautaire.

2026-07-30

LLM & Modèles4 min read

Optimisation des systèmes

DSpark montre que l’inférence rapide de l’IA est un problème d’ordonnancement, pas un tour de modèle

L’article de DSpark de DeepSeek révèle que le décodage spéculatif naïf dégrade le débit en situation de forte concurrence. Sa solution, la vérification à ordonnancement par confiance, adapte la longueur des blocs par requête et déplace la frontière de Pareto des performances de service.

2026-07-12

DeepSeek2 min read

Optimisation de l'inférence LLM

Aleph Alpha construit un modèle d'inférence théorique pour décoder les performances de DeepSeek V3 à partir de primitives matérielles

Le modèle théorique d'Aleph Alpha prédit les performances d'inférence de DeepSeek V3 à partir des seuls paramètres matériels, révélant comment le nombre de GPU et la bande passante d'interconnexion déplacent le goulot d'étranglement entre le calcul, la mémoire et la communication.

2026-07-04