Architecture GPU
AMD MI455X double la capacité mémoire, les tests de Hugging Face confirment un débit de requêtes multiplié par 3
Les premiers résultats de Hugging Face montrent que l'AMD Instinct MI455X peut gérer trois fois plus de requêtes simultanées que le MI300, grâce à 432 Go de mémoire HBM4. La bibliothèque Transformers atteint un taux de succès de 99,5 % sur 24 architectures de modèles clés.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-30 · 2 min de lecture

Lors de l'événement Advancing AI 2026 d'AMD, la société a dévoilé l'Instinct MI455X, un GPU pour centre de données avec 432 Go de mémoire HBM4 et 23,3 TB/s de bande passante. Cette capacité mémoire est environ 2,25 fois supérieure aux 192 Go de la génération précédente MI300. Pour les équipes exécutant de grands modèles de langage, l'effet immédiat est la nécessité de moins de cartes pour contenir un modèle et plus d'espace pour le cache clé-valeur qui croît avec chaque requête active.
Hugging Face a eu un accès anticipé à un système à quatre accélérateurs et a effectué un test de capacité préliminaire. Ils ont chargé un modèle Qwen3-32B BF16 de 64 Go sur un seul MI455X et ont augmenté le nombre de requêtes simultanées jusqu'à épuisement de la mémoire. Le MI300 a atteint sa limite en premier ; le MI455X a géré plus de trois fois plus de requêtes avant d'atteindre son propre plafond. La différence provient presque entièrement de la plus grande capacité du cache KV après le chargement des poids du modèle.
L'équipe a également exécuté la suite de tests Transformers sur 24 architectures de modèles importantes, y compris des encodeurs, des décodeurs, des modèles de vision et audio, ainsi que des systèmes multimodaux. Après des correctifs apportés avec AMD, le taux de succès a atteint environ 99,5 %, le plaçant dans la même fourchette que le MI300 à 99,4 % et le NVIDIA A10 à 99,1 %. Pour y parvenir, il a fallu activer un chemin Flash Attention stable, ajouter la prise en charge de torchcodec pour les entrées audio et vidéo, et résoudre des problèmes de comparaison de sortie découverts lors des tests.
La mémoire est devenue le goulot d'étranglement pour de nombreuses configurations d'inférence et de service. Les charges de travail à contexte long, les grandes tailles de lots et les conversations à plusieurs tours stimulent toutes la croissance du cache KV. Une seule carte pouvant contenir davantage de cet état signifie moins de nœuds, un réseau plus simple et une latence réduite grâce à une communication inter-périphériques moindre. Le MI455X ne prétend pas être plus rapide par FLOP que le MI300, AMD n'a pas encore partagé de détails sur la fréquence ou l'architecture, mais la mise à niveau de la mémoire à elle seule modifie l'économie pour quiconque empile de nombreux modèles petits à moyens sur une seule machine.
Ce que le test ne couvre pas encore, c'est le débit brut. Hugging Face a déclaré qu'il fournirait des comparaisons de vitesse au fur et à mesure de l'avancement des tests. Sans ces données, le MI455X est clairement un jeu de densité. Il est conçu pour les scénarios où le GPU manque de mémoire avant de manquer de capacité de calcul. Pour le service de modèles, c'est souvent le cas.
Hugging Face prévoit d'ajouter le MI455X à son pipeline d'intégration continue Transformers et d'étendre la validation à davantage de bibliothèques. La société travaille également avec l'équipe AITER d'AMD pour apporter des noyaux optimisés au Hugging Face Kernel Hub, ce qui permettrait aux utilisateurs de les invoquer directement depuis les workflows Transformers. Ces étapes sont importantes car la compatibilité avec l'écosystème existant est ce qui transforme une spécification matérielle en quelque chose qu'une équipe de science des données peut réellement utiliser le lundi matin.
- Source : AMD MI455X doubles memory capacity, Hugging Face tests confirm 3x request throughput — 2026-07-23
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.