AI硬件设备

AMD 正式发布 Instinct MI400 系列:MI455X 用上 HBM4,官方实测推理吞吐最高较上代 34 倍

2026年10月10日0 次阅读

一句话先说结论: AMD 在今年的 Advancing AI 大会上正式发布了新一代数据中心 AI 加速卡 Instinct MI400 系列,旗舰型号 MI455X 首次用上 HBM4 显存。按 AMD 官方公布的实测数据,跑 DeepSeek-V4-Flash 在线推理时,整机吞吐最高达到上一代 MI355X 的约 34 倍。本文性能数字均为 AMD 官方口径,第三方实测还没出来,基于多家媒体转述与官方博客整理。

这是件什么事

10 月上旬,AMD 一年一度的 Advancing AI 2026 大会举行,两个小时的 keynote 里硬件一条接一条:新一代 Instinct MI400 系列加速卡、Helios 整机架方案、新一代 CPU,OpenAI、Meta、Anthropic 的高管也先后登台。发布会后,AMD 的 ROCm 官方博客在 10 月 8 日发了一篇长文,把 MI455X 对上一代 MI355X 的推理成绩、测试方法和注意事项全部摊开讲了一遍,The Intel Brief、SimpleTechTrend 等媒体也在随后两天密集跟进解读。

简单说:这是 AMD 数据中心 AI 卡的年度旗舰换代,而且这次 AMD 不只发布了一块卡,而是把"一整个机架"当成一个产品来发。

官方实测数字:34 倍是怎么来的

先说最有代表性的端到端成绩:DeepSeek-V4-Flash 在线推理(输入 1024 token、输出 1024 token),MI455X 对 MI355X 的吞吐提升幅度取决于你要求多高的交互体验——

  • 要求每个用户每秒 20 token(主流客服、问答类应用的水平)时,吞吐是上代的 2.47 倍;
  • 交互门槛放得越宽松,吞吐倍数越高,在最低的交互门槛下最高冲到 约 34 倍。

这个"最高 34 倍"要看懂:它不是所有场景的日常倍数,而是吞吐优先、不太在意单用户速度的场景(比如离线批处理)拿到的峰值。官方博客自己把这条曲线的测试方法、中位数取值都写清楚了,态度算坦诚。

把 34 倍拆开看,来源主要是三块升级:

  • 显存换血:HBM3E → HBM4。 纯读取带宽实测最高提升 3 倍。大模型解码阶段是典型的"带宽饥饿"型负载,这是最基础的一层提升。
  • 算力升级:MXFP4 矩阵运算单卡最高 3.3 倍,MLA 解码注意力这种带宽型算子实测带宽最高 3.8 倍——带宽涨幅大于算力涨幅,恰恰说明解码瓶颈确实在内存上。
  • 互联重做:单对 GPU 之间的 scale-up 带宽最高 27 倍;MI455X 的 scale-up 域直接覆盖 一整个 72 卡的 Helios 机架,机架内任何两张卡通信都走交换、同速可达。

为什么重要:从卖卡到卖机架,还是开放路线

单看纸面参数,MI400 是"迭代升级";但放到行业格局里,有三件事值得注意。

第一,HBM4 商用落地。 HBM4 是这一代 AI 硬件竞争的关键军备——内存带宽决定推理成本。MI400 是最早一批把 HBM4 装进量产数据中心加速卡的产品线之一。

第二,机架级对标。 Helios 把 72 张 MI455X 当一个整体系统设计,正面对位 NVIDIA 的机架级方案。AMD 这次的叙事很明确:AI 算力单位已经从"一块卡"变成"一个机架",甚至"一个数据中心"。

第三,开放生态站位。 Helios 机架内部用 UALink over Ethernet,机架之间用 Ultra Ethernet 加自家 800G 网卡,全线走开放以太网标准,而不是私有铜背板。对下游的光模块、交换机供应商来说,这意味着更多的生意和更少的锁定。

客户名单也是这次发布会的底气:OpenAI 以 6GW 规模合作、Meta 同样 6GW,Anthropic 首次采用 Helios 机架。AMD 同时把 2030 年数据中心 AI 加速器的市场空间预测提高到了 1.4 万亿美元。

对谁有用

  • 做推理部署、算力采购的团队:MI400 世代把"保交互体验下的吞吐"作为主指标,如果你在评估大并发在线推理的方案,AMD 官方给了从测试配置到中位数数据的完整方法论,可以直接对照自己的业务场景复算。
  • 关注 GPU 竞争格局的读者:英伟达机架方案之外,现在有了一个开放标准、完整机架级的替代选项,且拿到了 OpenAI/Meta/Anthropic 级别的订单背书。
  • 开发者:ROCm 官方博客同步给出了基准复现细节,做 AMD 生态优化的团队可以按图索骥。

一点提醒

所有性能数字都出自 AMD 官方基准:自己比自己的上一代、特定模型(DeepSeek-V4-Flash)、特定负载与交互门槛。第三方独立实测还没有出现,"34 倍"是最宽松交互门槛下的峰值而非普遍体验。另外 MI500(2027,将引入光互联)已经挂上路线图,现在买不买、等不等,取决于你的部署节奏。但无论如何,"HBM4 + 机架级开放生态 + 头部客户订单"这三件事同时落地,让 MI400 成为今年 AI 硬件竞争里分量最重的一张牌之一。


参考来源:

  • AMD ROCm 官方博客:AMD Instinct MI455X vs MI355X: A Technical Look at the Advancing AI 2026 Inference Numbers(2026-10-08)— rocm.blogs.amd.com
  • The Intel Brief:AMD Unveils Instinct MI400 Series GPUs for AI and HPC at AAI 2026 — theintelbrief.com
  • SimpleTechTrend:AMD Advancing AI 2026: Open Ethernet in the Rack Backbone — simpletechtrend.com
  • AI Magazine:Meet the RTX Spark, Microsoft and NVIDIA's AI Superchip(同期行业报道)— aimagazine.com

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...