GPU架构
AMD MI455X内存容量翻倍,Hugging Face测试确认请求吞吐量提升3倍
Hugging Face的早期结果显示,得益于432 GB的HBM4内存,AMD Instinct MI455X能够处理比MI300多三倍的并发请求。Transformers库在24种关键模型架构上达到99.5%的成功率。

在AMD Advancing AI 2026活动上,该公司发布了Instinct MI455X,这是一款配备432 GB HBM4内存和23.3 TB/s带宽的数据中心GPU。这一内存容量大约是上一代MI300的192 GB的2.25倍。对于运行大型语言模型的团队来说,直接效果是容纳模型所需的显卡数量更少,并且为每个活跃请求增长的键值缓存留出更多空间。
Hugging Face提前使用了一个四加速器系统,并进行了初步容量测试。他们在单个MI455X上加载了一个64 GB的Qwen3-32B BF16模型,并增加并发请求数量直至内存耗尽。MI300首先达到极限;MI455X在达到自身上限之前处理了超过三倍的请求。这一差异几乎完全来自于加载模型权重后更大的KV缓存容量。
该团队还针对24种重要模型架构运行了Transformers测试套件,包括编码器、解码器、视觉和音频模型以及多模态系统。在与AMD合作修复问题后,成功率达到了约99.5%,与MI300的99.4%和NVIDIA A10的99.1%处于同一水平。实现这一目标需要启用稳定的Flash Attention路径,添加对音频和视频输入的torchcodec支持,并解决测试中发现的输出比较问题。
内存已成为许多推理和服务设置中的瓶颈。长上下文工作负载、大批量以及多轮对话都会推动KV缓存增长。一张能容纳更多状态的显卡意味着更少的节点、更简单的网络以及因跨设备通信减少而带来的更低延迟。MI455X并未声称在每FLOP性能上比MI300更快, , AMD尚未分享时钟或架构细节, , 但仅内存升级就改变了任何在一台机器上打包许多中小型模型的经济性。
该测试尚未涵盖原始吞吐量。Hugging Face表示,随着测试推进,将跟进速度对比。缺少这些数据,MI455X明显是一种密度策略。它专为GPU在计算能力耗尽之前内存先耗尽的场景而设计。对于模型服务来说,情况往往如此。
Hugging Face计划将MI455X添加到其Transformers持续集成管道中,并在更多库中扩展验证。该公司还与AMD的AITER团队合作,将优化内核引入Hugging Face内核中心,使用户能够直接从Transformers工作流中调用它们。这些步骤很重要,因为与现有生态系统的兼容性决定了硬件规格能否成为数据科学团队周一早上实际可用的东西。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。