IA5 min read
Deep Tech
Le routage partagé entre couches accélère l'attention sparse de 7x sans perte de qualité
CLSA utilise un seul passage de routage par séquence au lieu d'un par couche, réduisant les frais généraux du KV-cache tout en conservant la sélectivité au niveau des tokens. Les benchmarks montrent une amélioration du débit de 17,1x à 128K de contexte.
2026-07-26