SevenTnewS

optimisation de l'inférence

4 published articles

IA5 min read

Deep Tech

Le routage partagé entre couches accélère l'attention sparse de 7x sans perte de qualité

CLSA utilise un seul passage de routage par séquence au lieu d'un par couche, réduisant les frais généraux du KV-cache tout en conservant la sélectivité au niveau des tokens. Les benchmarks montrent une amélioration du débit de 17,1x à 128K de contexte.

2026-07-26

IA3 min read

Intelligence artificielle

La nouvelle bibliothèque megakernel d'Aleph Alpha réduit la latence d'inférence MoE de 200 %

Alpha-MoE fusionne plusieurs opérations en un seul noyau persistant pour obtenir jusqu'à 200 % de gains de vitesse d'inférence par rapport aux noyaux Triton dans vLLM et SGLang, ciblant les modèles MoE en précision FP8.

2026-07-09

IA2 min read

Analyse Approfondie

Aleph Alpha construit un modèle d'inférence théorique pour DeepSeek : Déduire les performances à partir des primitives matérielles

Aleph Alpha a créé un modèle d'inférence théorique pour DeepSeek v3 afin d'estimer le débit à partir des paramètres matériels, en analysant les compromis entre configurations GPU pour aider les praticiens à optimiser les performances et les coûts pour les grands modèles MoE.

2026-07-05

DeepSeek2 min read

Optimisation de l'inférence LLM

Aleph Alpha construit un modèle d'inférence théorique pour décoder les performances de DeepSeek V3 à partir de primitives matérielles

Le modèle théorique d'Aleph Alpha prédit les performances d'inférence de DeepSeek V3 à partir des seuls paramètres matériels, révélant comment le nombre de GPU et la bande passante d'interconnexion déplacent le goulot d'étranglement entre le calcul, la mémoire et la communication.

2026-07-04