DeepSeek V4 Flash、単一AMD MI300Xで動作確認

मूल शीर्षक: DeepSeek V4 Flash on a Single AMD MI300X

यह क्यों महत्वपूर्ण है

NVIDIAに依存しない推論環境の構築可能性を示し、AMD GPUでの大規模MoEモデル運用の参考事例となる。

開発者Ryan Zhouが、DeepSeek-V4-Flash-0731モデルをAMD MI300X 1基で本番稼働させる構成をGitHubで公開した。追加の量子化やオフロードなしで、シングルストリームデコード168.6トークン/秒、256Kコンテキストを検証済みとしている。

開発者Ryan Zhouは、DeepSeekの最新モデル「DeepSeek-V4-Flash-0731」をAMD MI300X 1基上で本番運用するための設定ファイルとパッチ群をGitHubリポジトリ「deepseek-v4-flash-mi300x」として公開した。

このリポジトリには、Docker Composeスタック、SHA-256でピン留めされたファイルオーバーレイ、上流との差分パッチ、チューニングテーブルが含まれる。使用スタックはvLLM ROCm nightly(0.26.1rc1.dev229)とAITER 0.1.19。

公開されたベンチマーク結果は以下の通り。シングルストリームデコード(中央値)168.6トークン/秒、チューニング済みカーネルでのプリフィル約7,900〜8,500トークン/秒、8並列ストリームで合計542トークン/秒(中央値90.3トークン/秒)、64ストリームバースト時に合計830トークン/秒でOOMなし。重みのHBM使用量は156.67GiBで、追加量子化・オフロードは不要。コンテキスト長は256Kを検証済みで、アーキテクチャ上は1Mをサポートする。

公式vLLMレシピはNVIDIAおよび新世代AMD向けに設計されているため、MI300X上での安定稼働にはFP8フォーマット、高並列時のMoEルーティング、因果的投機的検証、CPU-KV同期、未調整カーネル形状など複数の問題への対処が必要だったとしている。

स्रोत

github.com — मूल लेख पढ़ें →