Gemma 4 26Bをわずか2GBのRAMで動かすOSSエンジン
मूल शीर्षक: Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac
यह क्यों महत्वपूर्ण है
大規模MoEモデルをSSDストリーミングで低メモリ動作させる手法は、エッジ推論の普及と個人ユーザーへのLLMアクセシビリティ向上に直結する。
開発者drumihが、Apple Silicon搭載MacでGoogle製AIモデルGemma 4 26B-A4Bをわずか約2GBのRAMで動作させるオープンソースエンジン「TurboFieldfare」をGitHubで公開した。Swift + Metal製のカスタムランタイムで8GB MacBookでも動作する。
「TurboFieldfare」は、通常14.3 GBのメモリを必要とするGemma 4 26B-A4Bモデルを、約2 GBのRAMで推論実行できるカスタムエンジンである。開発者のdrumihがApache-2.0ライセンスのもとGitHubで公開し、公開後まもなく574スター・18フォークを獲得している。
技術的な仕組みとして、モデル全体をメモリに読み込む代わりに、共有コア(約1.35 GB)とFP16 KVキャッシュのみをメモリ上に常駐させ、各トークン生成に必要なエキスパート(Mixture of Experts構造の一部)だけをSSDからストリーミングする方式を採用している。これにより、8 GBのRAMしか持たないMacBookを含む、すべてのApple Silicon(M系列)搭載Macでの動作を実現した。
実装言語はSwiftとMetal(AppleのGPU向けシェーダー言語)で、MacOSネイティブの最適化が施されている。リポジトリにはベンチマーク結果、ローカルサーバー機能、コントリビューション手順も含まれており、コミュニティからの結果提供も募っている。Gemma 4 26B-A4BはGoogleが公開した命令チューニング済みMoEモデルで、パラメータ数26Bのうち推論時には一部のみが活性化される構造を持つ。