atención dispersa
2 published articles
IA5 min read
Tecnología profunda
El enrutamiento compartido entre capas acelera la atención dispersa 7 veces sin afectar la calidad
CLSA utiliza un único paso de enrutamiento por secuencia en lugar de uno por capa, reduciendo la sobrecarga de la caché KV mientras mantiene la selectividad a nivel de token. Los benchmarks muestran una mejora de 17,1 veces en el rendimiento con un contexto de 128K.
2026-07-26
Laboratorios e InvestigaciónFeatured3 min read
Laboratorios de IA e Investigación
MiniMax M3 acaba de escribir su propio kernel CUDA y abrió el código
MiniMax M3 obtiene 83.5 en BrowseComp, supera a Opus 4.7 por 4.7 puntos y maneja hasta 1 millón de tokens de forma nativa. En una prueba de autonomía notable, auto-optimizó un kernel de GPU desde un 7.6% hasta un 71.3% de utilización máxima sin intervención humana.
2026-07-09