IA5 min read
Tecnología profunda
El enrutamiento compartido entre capas acelera la atención dispersa 7 veces sin afectar la calidad
CLSA utiliza un único paso de enrutamiento por secuencia en lugar de uno por capa, reduciendo la sobrecarga de la caché KV mientras mantiene la selectividad a nivel de token. Los benchmarks muestran una mejora de 17,1 veces en el rendimiento con un contexto de 128K.
2026-07-26