Gemma 4 26Bをわずか2GBのRAMで動かすOSSエンジン

मूल शीर्षक: Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

यह क्यों महत्वपूर्ण है

大規模MoEモデルをSSDストリーミングで低メモリ動作させる手法は、エッジ推論の普及と個人ユーザーへのLLMアクセシビリティ向上に直結する。

開発者drumihが、Apple Silicon搭載MacでGoogle製AIモデルGemma 4 26B-A4Bをわずか約2GBのRAMで動作させるオープンソースエンジン「TurboFieldfare」をGitHubで公開した。Swift + Metal製のカスタムランタイムで8GB MacBookでも動作する。

「TurboFieldfare」は、通常14.3 GBのメモリを必要とするGemma 4 26B-A4Bモデルを、約2 GBのRAMで推論実行できるカスタムエンジンである。開発者のdrumihがApache-2.0ライセンスのもとGitHubで公開し、公開後まもなく574スター・18フォークを獲得している。

技術的な仕組みとして、モデル全体をメモリに読み込む代わりに、共有コア(約1.35 GB)とFP16 KVキャッシュのみをメモリ上に常駐させ、各トークン生成に必要なエキスパート(Mixture of Experts構造の一部)だけをSSDからストリーミングする方式を採用している。これにより、8 GBのRAMしか持たないMacBookを含む、すべてのApple Silicon(M系列)搭載Macでの動作を実現した。

実装言語はSwiftとMetal(AppleのGPU向けシェーダー言語)で、MacOSネイティブの最適化が施されている。リポジトリにはベンチマーク結果、ローカルサーバー機能、コントリビューション手順も含まれており、コミュニティからの結果提供も募っている。Gemma 4 26B-A4BはGoogleが公開した命令チューニング済みMoEモデルで、パラメータ数26Bのうち推論時には一部のみが活性化される構造を持つ。

स्रोत

github.com — मूल लेख पढ़ें →