SevenTnewS

Tecnología profunda

El enrutamiento compartido entre capas acelera la atención dispersa 7 veces sin afectar la calidad

CLSA utiliza un único paso de enrutamiento por secuencia en lugar de uno por capa, reduciendo la sobrecarga de la caché KV mientras mantiene la selectividad a nivel de token. Los benchmarks muestran una mejora de 17,1 veces en el rendimiento con un contexto de 128K.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-26 · 5 min de lectura

El enrutamiento compartido entre capas acelera la atención dispersa 7 veces sin afectar la calidad
Fuentes : CLSA: You Only …

La atención sigue siendo el cuello de botella. Cada token adicional de contexto en un transformador implica más claves y valores que almacenar y examinar, y decodificar una larga cadena de pensamiento puede detenerse incluso en hardware de alto rendimiento. La atención dispersa intenta solucionar esto ignorando las partes irrelevantes de la caché, pero la solución a menudo cuesta precisión (bloque disperso) o velocidad (token disperso, donde seleccionar los tokens correctos en cada capa es su propio cuello de botella).

Un nuevo artículo, CLSA: You Only Index Once, argumenta que ambos problemas tienen una causa raíz única: cada capa ejecuta su propio enrutamiento de forma independiente. Los autores proponen compartir el índice de enrutamiento entre las capas en una arquitectura de caché KV compartida, de modo que la costosa selección de top-k se ejecute una vez y el resultado se reutilice. Los experimentos reportan hasta 7,6 veces más velocidad de decodificación y 17,1 veces mejor rendimiento general con 128K tokens, con una precisión que iguala a la atención completa en benchmarks estándar.

Es un caso raro donde la solución arquitectónica mejora tanto la eficiencia como la calidad del modelo al mismo tiempo, en lugar de intercambiar una por la otra.

Cómo funciona CLSA

El método se basa en arquitecturas de atención híbridas que comparten cachés KV entre capas de decodificación cruzada, como la familia YOCO. En esos modelos, la caché KV ya se reutiliza, pero cada capa de decodificación cruzada aún ejecuta su propio enrutamiento top-k sobre la caché completa. CLSA agrega una capa indexadora compartida: calcula las puntuaciones de atención una vez, selecciona los tokens top-k y pasa ese mismo índice a cada capa subsiguiente.

Ese único paso reemplaza N pasos de enrutamiento, donde N es el número de capas de decodificación cruzada. El enrutamiento en sí mismo se convierte en un costo fijo en lugar de uno lineal en el número de capas, lo que importa más a medida que los modelos se vuelven más profundos y los contextos más largos.

El movimiento clave es mantener la dispersión a nivel de token, la selección de grano fino que hace alta la precisión, mientras se amortiza la sobrecarga que normalmente la hace lenta. Los métodos de bloque disperso saltan páginas de memoria completas por velocidad pero pierden tokens relevantes dentro de los bloques saltados. CLSA evita eso manteniendo la granularidad por token y pagándola exactamente una vez.

Schéma : CLSA: Shared Routing Across Layers
CLSA utiliza una única capa indexadora para calcular un índice de enrutamiento top-k compartido, que reemplaza N pasos de enrutamiento separados entre las capas del decodificador cruzado, logrando una decodificación hasta 7,6 veces más rápida.

De dónde proviene la velocidad

El artículo mide tres etapas de inferencia: precarga (procesamiento del prompt), almacenamiento en caché KV (la huella de memoria de las claves y valores almacenados en caché) y decodificación autorregresiva (generación de tokens uno por uno). Las tres mejoran simultáneamente:

MétricaMejora vs. atención completa
Velocidad de decodificación (contexto 128K)7,6x
Rendimiento general (contexto 128K)17,1x
Memoria de caché KVProporcional a la tasa de dispersión top-k (generalmente 5, 20% del total)

Estos números provienen de un modelo con una ventana de contexto de 128K tokens. Solo la aceleración de la decodificación, 7,6x, significa que una generación que toma 8 segundos con atención completa se completa en poco más de 1 segundo con CLSA. Las ganancias de rendimiento son aún mayores porque el modelo puede procesar más solicitudes por lotes con la huella de memoria reducida.

La precisión se mantiene

En el benchmark de contexto largo RULER (promediado en cinco plantillas de prompting y múltiples longitudes), CLSA iguala la atención completa dentro de 0,5 puntos. En tareas de contexto corto, MMLU, ARC-Challenge, HellaSwag, la diferencia está por debajo de 0,3 puntos. Eso es esencialmente ruido. En GSM8K (razonamiento matemático), la brecha se amplía a aproximadamente 1,2 puntos, que los autores atribuyen al hecho de que las selecciones pequeñas de tokens pueden perder números críticos en cadenas aritméticas.

Aún así, la compensación es inusual: un método que ofrece una ganancia de velocidad de 7x mientras pierde menos de 1,5 puntos en cualquier benchmark es raro entre las propuestas de atención dispersa. Los métodos de bloque disperso suelen perder 3, 5 puntos en las mismas tareas por una velocidad comparable.

La estabilidad de la precisión proviene del hecho de que el índice de enrutamiento se calcula una vez utilizando las puntuaciones de atención de la capa indexadora, que ve el mismo estado de consulta y caché que cualquier otra capa, el conjunto top-k para una capa es un proxy sólido para el conjunto top-k de todas las capas en una arquitectura de caché compartida.

El costo: limitaciones de compatibilidad

CLSA no es un reemplazo directo para cualquier transformador. Requiere una estructura de caché KV compartida (YOCO, o modelos construidos con capas de decodificación cruzada) para funcionar. Un transformador estándar solo decodificador que no comparte cachés entre capas no se beneficiaría del enrutamiento compartido, porque la caché KV de cada capa es diferente y el índice apuntaría a entradas obsoletas.

Los profesionales que utilizan decodificación especulativa para razonamiento de contexto largo pueden encontrar que CLSA es complementario, el modelo borrador podría usar el mismo enrutamiento compartido para velocidad, mientras que el modelo objetivo ejecuta atención completa para verificación. El artículo no explora esta combinación, pero las arquitecturas son compatibles.

La otra limitación es el recuento fijo de selección top-k. El artículo utiliza k=512 tokens de una caché de 128K, aproximadamente un 0,4% de densidad. Para tareas que requieren atención muy densa, por ejemplo, escanear cada token de un contrato financiero para una comprobación de cumplimiento, una dispersión tan agresiva puede perder detalles incluso si el índice de enrutamiento es preciso. Los autores sugieren que la capa indexadora puede ajustar k dinámicamente, pero esto se deja como trabajo futuro.

Lo que significa para la inferencia de contexto largo

La afirmación más sólida del artículo es que la compensación entre eficiencia y precisión no es inevitable, es un artefacto del enrutamiento independiente por capa. Un único paso de enrutamiento compartido resuelve ambos lados: la precisión se mantiene alta porque la selección es a nivel de token, y la velocidad mejora porque el costo de enrutamiento se amortiza entre capas.

Con un contexto de 128K, la ganancia de rendimiento de 17x significa que una sola GPU puede servir aproximadamente 17 veces más solicitudes concurrentes de contexto largo que con atención completa. Para los proveedores de inferencia en la nube, eso reduce directamente el costo por token. Para los modelos de peso abierto en dispositivos, reduce la brecha de memoria y latencia entre ejecutar prompts cortos y largos.

Todavía hay preguntas abiertas: cómo se comporta CLSA más allá de 128K (el artículo prueba hasta ese punto); si la selección dinámica de k puede cerrar la brecha de <1,5 puntos en tareas de razonamiento aritmético; y cómo se escala el método a modelos de 70B+ parámetros donde el propio índice de enrutamiento se convierte en una gran estructura de datos. Pero como solución al cuello de botella específico que hace costosa la inferencia de contexto largo, aborda el cuello de botella correcto de manera fundamentada.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.