Kimi K3を29GBのRAMで動作させる新ツール公開
मूल शीर्षक: Run Kimi K3 using 29 GB of RAM at 0.50 tok/s
यह क्यों महत्वपूर्ण है
大規模モデルをコンシューマー向けハードウェアで動作させる手法の普及が進み、AI推論の民主化に向けた技術的な選択肢が広がる。
GitHubユーザーsqliteaiが、2.78兆パラメータのKimi K3モデルを29GBのRAMと0.50トークン/秒で動作させるオープンソースツール「WASTE」を公開した。NVMeから直接重みをストリーミングする手法を採用している。
sqliteaiがGitHubで公開したオープンソースプロジェクト「WASTE(Weight-Aware Streaming Tensor Engine)」は、Kimi K3の2.78兆パラメータモデルを、通常では必要とされる大容量メモリなしに動作させる推論エンジンです。
WASTEの主な特徴は、NVMe(高速ストレージ)から活性化された重みを直接ストリーミングすることで、利用可能なRAMを超えたモデル実行を可能にする点です。サードパーティのランタイム依存関係が一切なく、C言語で記述された組み込み可能な推論エンジンとして設計されています。
公式のデモでは、64GBのRAMを搭載したコンシューマー向けラップトップ上で、約46.24GBを使用してKimi K3を実行し、「イタリアの首都は?」という質問に対して約31秒で16トークンを生成(約0.51トークン/秒)しています。エキスパートキャッシュのヒット率は約14%でした。
プロジェクトはApache-2.0ライセンスで公開されており、GitHubにて374スター、35フォークを獲得しています。リポジトリにはCLI、サーバー機能、各種ツールが含まれています。