SevenTnewS

Arquitectura de GPU

AMD MI455X duplica la capacidad de memoria, pruebas de Hugging Face confirman 3x en rendimiento de solicitudes

Los primeros resultados de Hugging Face muestran que el AMD Instinct MI455X puede manejar el triple de solicitudes concurrentes que el MI300, gracias a 432 GB de memoria HBM4. La biblioteca Transformers logra una tasa de éxito del 99.5% en 24 arquitecturas de modelos clave.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-30 · 2 min de lectura

AMD MI455X duplica la capacidad de memoria, pruebas de Hugging Face confirman 3x en rendimiento de solicitudes

En el evento Advancing AI 2026 de AMD, la compañía presentó el Instinct MI455X, una GPU para centros de datos con 432 GB de memoria HBM4 y 23.3 TB/s de ancho de banda. Esa capacidad de memoria es aproximadamente 2.25 veces los 192 GB de la generación anterior MI300. Para los equipos que ejecutan grandes modelos de lenguaje, el efecto inmediato es que se necesitan menos tarjetas para alojar un modelo y más espacio para la caché clave-valor que crece con cada solicitud activa.

Hugging Face tuvo acceso temprano a un sistema de cuatro aceleradores y realizó una prueba de capacidad preliminar. Cargaron un modelo Qwen3-32B BF16 de 64 GB en un solo MI455X y aumentaron el número de solicitudes concurrentes hasta que se agotó la memoria. El MI300 alcanzó primero su límite; el MI455X manejó más del triple de solicitudes antes de llegar a su propio techo. La diferencia proviene casi por completo de la mayor capacidad de caché KV después de cargar los pesos del modelo.

El equipo también ejecutó el conjunto de pruebas de Transformers contra 24 arquitecturas de modelos importantes, incluidos codificadores, decodificadores, modelos de visión y audio, y sistemas multimodales. Después de las correcciones aportadas con AMD, la tasa de éxito alcanzó aproximadamente el 99.5 por ciento, situándose en el mismo rango que el MI300 con un 99.4 por ciento y la A10 de NVIDIA con un 99.1 por ciento. Lograrlo requirió habilitar una ruta estable de Flash Attention, agregar soporte de torchcodec para entradas de audio y video, y resolver problemas de comparación de salidas descubiertos durante las pruebas.

La memoria se ha convertido en el cuello de botella para muchas configuraciones de inferencia y servicio. Las cargas de trabajo de contexto largo, los tamaños de lote grandes y las conversaciones de múltiples turnos impulsan el crecimiento de la caché KV. Una sola tarjeta que pueda contener más de ese estado significa menos nodos, redes más simples y menor latencia gracias a la reducción de la comunicación entre dispositivos. El MI455X no afirma ser más rápido por FLOP que el MI300; AMD aún no ha compartido detalles de reloj o arquitectura, pero la mejora de memoria por sí sola cambia la economía para cualquiera que empaquete muchos modelos pequeños y medianos en una sola máquina.

Lo que la prueba aún no cubre es el rendimiento bruto. Hugging Face dijo que continuará con comparaciones de velocidad a medida que avancen las pruebas. Sin esos datos, el MI455X es claramente una apuesta por la densidad. Está diseñado para escenarios donde la GPU se queda sin memoria antes de quedarse sin capacidad de cómputo. Para el servicio de modelos, ese suele ser el caso.

Hugging Face planea agregar el MI455X a su canal de integración continua de Transformers y expandir la validación a más bibliotecas. La compañía también está trabajando con el equipo AITER de AMD para llevar kernels optimizados al Hugging Face Kernel Hub, lo que permitiría a los usuarios invocarlos directamente desde los flujos de trabajo de Transformers. Estos pasos son importantes porque la compatibilidad con el ecosistema existente es lo que convierte una especificación de hardware en algo que un equipo de ciencia de datos puede usar realmente el lunes por la mañana.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.