AMD MI355X、Kimi K3をB300より高コスパで動作

Judul asli: Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

Mengapa Ini Penting

大規模オープンソースモデル時代におけるNVIDIA以外のGPUの実用的コスト競争力を示す事例

Wafer AIがAMD MI355X上でKimi K3(2.8兆パラメータ)を952トークン/秒/ノードで動作させ、B300比でコストパフォーマンスが約1.45倍優れると報告。

Wafer AIは2026年7月31日、AMD MI355X上でMoonshot AIの大規模オープンソースモデル「Kimi K3」(2.8兆パラメータ)を稼働させた技術報告を公開した。Kimi K3はVRAMだけで1.5TB以上を必要とし、B200の8GPU構成(1ノード)では搭載不可。対応できるのはB300ノード(288GB/GPU)またはB200を2ノード使うTP16構成に限られるが、MI355Xも同じく288GBのVRAMを持つ。

ベンチマーク(入力1,024トークン/出力400トークン)では、MI355X(TP8)が952トークン/秒(ノード合計)・118トークン/秒(単一ストリーム)を達成。B200のTP16構成(498トークン/秒、2ノード合計)と比べ、ノード単位で約3.8倍のスループットを記録した。B300は1,568トークン/秒とスループットでは上回るが、GPU時間あたりのコスト(MI355X約2.50ドル、B300約6.00ドル)を考慮したコストパフォーマンス(tok/s/$)ではMI355Xが48対33と逆転する。

技術面では、Kimi K3がドラフトテンソルを含まないため、外部ブロック拡散ドラフト(RadixArk製Kimi-K3-DSpark)を用いた投機的デコードを実装。ROCm環境では`top_k_renorm_prob`未定義エラーが発生し、独自修正が必要だったと報告している。

Sumber

wafer.ai — Baca artikel asli →