Redisの作者がローカルLLM推論エンジンds4を公開

原題: From the creator of Redis; run LLM locally with ds4

なぜ重要か

クラウド依存なしに284Bクラスのモデルをローカル実行できる選択肢が増え、プライバシーやコスト面での自律性が高まる。

Redis作者のSalvatore Sanfilippoが、ローカル環境でフロンティア級LLMを動作させるC言語製推論エンジン「DwarfStar 4(ds4)」を公開した。DeepSeek V4/V4.1 Flash、GLM 5.x、Qwen3.8に対応し、Apple Silicon Mac(64GB以上)・NVIDIA CUDA・AMD ROCmをサポート。MIT Licenseで提供される。

ds4は、284億パラメータのMixture-of-Expertsモデル「DeepSeek V4 Flash」をはじめとするフロンティアモデルを、クラウドではなくローカルマシンで動作させることを目的に設計されたC言語製の推論エンジンだ。

設計の中核にあるのは「非対称2ビット量子化」だ。ルーティングされたエキスパート部分を集中的に圧縮しながら、共有された重要パスの精度は維持する。これにより284Bパラメータのモデルが高メモリマシン上で実用的に動作する。

KVキャッシュの扱いも独特だ。プロンプトプレフィックスのSHA1ハッシュをキーとしてSSDに永続化し、サーバー再起動後も再計算なしに同じプレフィックスを復元できる。長い会話コンテキストを頻繁に扱う用途で恩恵が大きい。

インターフェースは3系統。`./ds4`でインタラクティブなCLIチャット、`./ds4-server`でOpenAI・Anthropic互換のローカルAPIサーバー、`./ds4-agent`でコーディング用の永続エージェントを起動できる。いずれも同一のモデル状態とキャッシュを共有する設計だ。

対応ハードウェアは、Apple Silicon Mac(64GB以上)、NVIDIA DGX SparkなどのCUDA環境、AMD Strix HaloなどのROCm環境。Mac Studio 512GBではV4.1のQ4量子化モデルも動作するとされる。GGUFファイルは汎用ランナーとの互換を狙ったものではなく、ds4が検証した特定のレイアウトのみを対象としている点に注意が必要だ。

セットアップは3ステップ。GitHubからリポジトリをcloneし、`download_model.sh`でモデルを取得、バックエンドに応じて`make`または`make cuda-spark`でビルドするだけだ。GitHubのスター数はすでに19,000を超えている。

出典

dwarfstar.sh — 元記事を読む →