125B AIモデルをRTX 4090で動かすOSS「Strata」

原題: Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

なぜ重要か

サーバー不要でLLMをローカル運用できる環境が整いつつあり、プライバシーやコスト面での個人・中小企業の選択肢が広がる点で注目される。

開発者のNiko1221氏がGitHubで公開した推論エンジン「Strata」は、パラメータ数1250億のQwen3.8-Flash-Nextを、RTX 4090などのコンシューマー向けGPU(VRAM 12GB以上)で毎秒100トークン以上の速度で動作させることができる。Windows・Linux対応のワンクリックインストールに対応し、OpenAI・Anthropic互換のローカルAPIも提供する。スターは1万件を超えた。

「Strata」はQwen3.8-Flash-Nextをゲーミング向けPCで実行するために設計されたオープンソースの推論エンジンだ。通常、1250億パラメータ規模のモデルはデータセンター規模のサーバーを必要とするが、Strataは量子化(IQ3_Sなど)を活用することで、VRAM 12GB以上のNVIDIAまたはAMD GPUでの動作を実現している。

公式READMEによると、RTX 4090での推論速度は毎秒100トークン以上を達成。128Kコンテキスト長にも対応しており、テキストチャット・コード生成・画像入力をサポートする。インターフェースはOpenAIおよびAnthropic互換のローカルAPIとして機能するため、既存ツールとの統合も容易だ。

セットアップはWindows向けに`START-HERE.bat`・`SETUP.bat`、Linux向けに`setup.sh`が用意されており、コマンドライン操作に不慣れなユーザーでも導入できる構成となっている。Dockerにも対応する。

READMEではRTX 5070を使った128Kコンテキストでのボクセルアート生成のデモ動画(49秒)も公開されており、ワンショットプロンプトから高品質な画像生成が行われた様子が確認できる。

リポジトリは公開直後から急速に注目を集め、GitHubスターは1万件超、フォーク数は906件に達している。ライセンスはMIT。Issue・Pull Requestともに活発に動いており、コミュニティ主導での機能追加が進んでいる段階だ。

出典

github.com — 元記事を読む →