Wafer AI deploys Kimi K3 on 8 AMD MI355X, matching 16 NVIDIA B200 performance
Wafer AI deployed the 2.8-trillion-parameter Kimi K3 model on eight AMD MI355X GPUs in a single server, achieving 952 tokens/s total throughput and 118 tokens/s per-user generation speed. This matches the performance of a 16-GPU NVIDIA B200 dual-server setup, with 3.8x the per-node throughput and higher cost-effectiveness than B200 and B300. The MI355X's 288 GB memory per GPU allows the model to fit in one node, avoiding cross-node communication overhead.
Coverage timeline
机器之心机器之心
这可能是 AMD 等了很久的时刻。 最近,Wafer AI 在 AMD MI355X 上部署了 Kimi K3。结果是,原本需要 16 张 NVIDIA B200、横跨两台服务器运行的模型,在一台配备 8 张 MI355X 的 AMD 服务器中就能完成部署。 更关键的是,它不只是把模型装进去了。 在输入 1024 Token、输出 400 Token 的测试中,MI355X 跑出了 952 Token/s 的总吞吐量,单用户生成速度达到 118 Token/s。 按照单节点计算,它的吞吐量约为 16 卡 B200 方案的 3.8 倍,性价比也超过了 B200 和 B300。 而最让人意外的是,ROCm 这次居然没有特别折腾。 模型太大,显存开始比算力更重要 Kimi K3 拥有 2.8 万亿参数,仅模型权重就需要超过 1.5 TB 显存,还没算百万 Token 上下文所需的 KV Cache。 一台 8 卡 B200 服务器,每张卡有 192 GB 显存,总容量约为 1.5 TB。也就是说,模型权重都很难完整放下,更别说给 KV Cache 留空间。因此,B200 必须使用两台服务器、16 张 GPU。 B300 每张卡拥有 288 GB 显存,可以在单节点内装下模型。巧的是,AMD MI355X 同样拥有 288 GB 显存,8 张 MI355X 合计约 2.3 TB,一台服务器就够了。 这不只是少用一台机器。模型跨节点运行后,每生成一个 Token,都可能需要通过网络同步数据。即使使用约 195 Gb/s 的 RoCE v2 网络,跨节点通信仍然会拖慢解码。 MI355X 靠更大的显存,把整个模型留在了一个节点里。 从最终结果看,8 张 MI355X 的峰值总吞吐量达到 952 Token/s,单路生成速度为 118 Token/s。 作为对比,16 张 B200 的双节点部署总吞吐量为 498 Token/s,换算到单节点约为 249 Token/s。 也就是说,MI355X 的单节点吞吐量约为 B200 双节点部署平均单节点吞吐量的 3.8 倍。单用户生成速度方面,MI355X 的 118 Token/s 也高于 B200 的 90 Token/s。 B300 依然是绝对性能最高的方案。8 张 B300 的节点总吞吐量达到 1568 Token/s,单路生成
