IoT & CapteursFeatured6 min read
Recherche en IA
Comment BMW a intégré 16 000 tokens de contexte dans un GPU de 16 Go en repensant l'attention
Des chercheurs de BMW montrent que l'Attention Globale Hiérarchique, associée à une rétropropagation tronquée et à un stockage KV externe, permet à un GPU de 16 Go de s'entraîner sur 16 000 tokens, soit quatre fois la limite de l'attention dense, sans perte mesurable de qualité de l'adaptateur.
2026-07-20