AMD MI355XでKimi K3をB300より安価に高速動作

मूल शीर्षक: Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

यह क्यों महत्वपूर्ण है

2.8Tパラメータ級モデルの実用推論において、AMDがコスト効率でNVIDIA Blackwellを上回ることを具体的数値で示した初事例の一つ。

AIインフラ企業Waferは2026年7月31日、AMD MI355X上でKimi K3(2.8兆パラメータ)を952トークン/秒/ノードで動作させ、コスト効率でNVIDIA B300を上回ると発表した。MI355XのGPU単価はB300比約2.4倍安く、1ドルあたりのスループットは48対33トークン/秒となった。

Waferは2026年7月31日、AMD MI355X上でKimi K3の推論ベンチマーク結果を公開した。Kimi K3はMoonshotが開発したオープンソースモデルで、パラメータ数は2.8兆(2.8T)に達し、KVキャッシュなしでも1.5TB超のVRAMを必要とする。NVIDIA B200の8GPU1ノード(計1.5TB VRAM)では重みが収まらず、B200では2ノード16GPU構成(TP16)が必要となる。一方、MI355XはGPUあたり288GBのHBMを搭載し、8GPU1ノード(TP8)でKimi K3を動作可能。B300も同様に288GB/GPUだが、GPU単価はMI355Xの約2.4倍とされる。

ベンチマーク(入力1,024トークン/出力400トークン)では、MI355X(TP8)が952トークン/秒(ピーク集計)、シングルストリーム118トークン/秒を記録。B200 TP16は498トークン/秒(2ノード合計、1ノードあたり約249)、B300は1,568トークク/秒だった。GPU時間あたりのコストをMI355X 2.50ドル、B300 6.00ドル、B200 4.25ドルで計算すると、ドルあたりスループットはMI355Xが48トークン/秒/ドルで最高、次いでB300が33、B200が7となった。

ソフトウェア面では、Kimi K3のAMD ROCm向けday-0サポートによりほぼそのまま動作したが、投機的デコード(speculative decode)の有効化に際してROCm環境で`top_k_renorm_prob`未定義エラーが発生。sglangのROCmビルドにおけるカーネルエイリアスの差異が原因で、Waferのエンジニアリングチームが修正を行った。

स्रोत

wafer.ai — मूल लेख पढ़ें →