Kimi K3、AMD MI355X でB300より高コスパを実現

Original : Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

Pourquoi c'est important

大規模モデル時代において、HBM容量がGPU選定の決定的要因になりつつある。

Wafer AIは、AMD MI355X(8GPU)でKimi K3(2.8兆パラメータ)を952トークン/秒/ノードで動作させることに成功。B300比約2.4倍安価なGPUで、性能コスト比でB300とB200を大幅に上回る結果を達成した。

Wafer AIは2026年7月31日、AMD MI355X上でオープンソースモデルKimi K3(2.8兆パラメータ、VRAM要件1.5TB超)を動作させたと発表した。同モデルはNVIDIA B200の1ノード(8GPU×192GB)には収まらず、B300ノードまたはB200を2ノード(TP16)使用する必要がある。MI355XはB300と同じ288GB/GPUのVRAMを持ちながら、GPU単価はB300比約2.4倍、B200比約1.7倍安価だ。ベンチマーク(入力1,024トークン/出力400トークン)では、MI355X(TP8)が952トークン/秒(集計)・118トークン/秒(単一ストリーム)を記録。B200 TP16構成の498トークン/秒(2ノード合計)を大きく上回り、コスト効率では48 tok/s/ドルを達成(B300:33、B200:7)。技術面では、ROCm環境でspeculative decodeのスケジューラエラー(`top_k_renorm_prob`未定義)が発生したが、Waferのエンジニアリングチームが対処した。AMDによるKimi K3向けday-0サポートが提供されており、実装の大部分は既に整備されていた。

Source

wafer.ai — Lire l'original →