attention éparse
2 published articles
IA5 min read
Deep Tech
Le routage partagé entre couches accélère l'attention sparse de 7x sans perte de qualité
CLSA utilise un seul passage de routage par séquence au lieu d'un par couche, réduisant les frais généraux du KV-cache tout en conservant la sélectivité au niveau des tokens. Les benchmarks montrent une amélioration du débit de 17,1x à 128K de contexte.
2026-07-26
Laboratoires & RechercheFeatured3 min read
Laboratoires et recherche en IA
Le M3 de MiniMax vient d’écrire son propre noyau CUDA et a ouvert le code
Le MiniMax M3 obtient 83,5 sur BrowseComp, dépasse Opus 4,7 de justesse et gère jusqu’à 1 million de jetons en natif. Dans un test d’autonomie remarquable, il a auto-optimisé un noyau GPU de 7,6 % à 71,3 % d’utilisation maximale sans intervention humaine.
2026-07-09