DeepSeek V4 Flash、AMD MI300X 1枚で稼働成功

Judul asli: DeepSeek V4 Flash on a Single AMD MI300X

Mengapa Ini Penting

NVIDIA 以外の GPU で最先端 MoE モデルを本番稼働できる実績が示され、AI インフラの選択肢拡大に寄与する。

開発者 ryanzhou が DeepSeek-V4-Flash-0731 を AMD MI300X 1枚で本番稼働させる構成を公開。追加量子化なしで重みサイズ 156.67 GiB、256K コンテキストを検証済み。

GitHub ユーザー ryanzhou が、DeepSeek AI の大規模言語モデル「DeepSeek-V4-Flash-0731」を AMD MI300X GPU 1枚で本番運用するための構成一式を公開した。リポジトリには Docker Compose スタック、SHA-256 固定ファイルオーバーレイ、アップストリームとの差分パッチ、チューニングテーブルが含まれる。

実測結果(vLLM ROCm nightly 0.26.1rc1 / AITER 0.1.19)は以下の通り。シングルストリームデコードの中央値は毎秒 168.6 トークン、チューニング済みカーネルでのプリフィルは最大約 8,500 トークン/秒。8 並列ストリームでは集計 542 トークン/秒、64 並列バーストでは OOM なしで 830 トークン/秒を記録した。コンテキスト長 256K を検証済みで、アーキテクチャ上は 1M にも対応する。モデル重みは追加量子化なしで HBM に 156.67 GiB 収まる。

公式の vLLM レシピは NVIDIA および新世代 AMD ハードウェアを対象としており、MI300X での安定稼働には FP8 フォーマット、高並列時の MoE ルーティング、因果的推測検証、CPU-KV 同期など複数の問題修正が必要だったとしている。

Sumber

github.com — Baca artikel asli →