ブラウザで7つの小型LLMを試せるMicroLLM Lab公開
मूल शीर्षक: MicroLLM Lab – Try 7 tiny LLM's in the browser
यह क्यों महत्वपूर्ण है
クラウドLLMへの依存を減らすエッジAIの実用性を、一般ユーザーが手軽に検証できる場が増えつつあることを示している。
stateofutopia.comが「MicroLLM Lab」を公開。WebGPUを使い、25M〜360Mパラメータの小型言語モデル7種をブラウザ上で動作・比較できる。Q4量子化により50〜84MBのメモリで動作し、サーバー不要・完全プライベートで利用可能。
MicroLLM Labは、WebGPUを活用してブラウザ内で小型言語モデル(SLM)を直接実行・ベンチマーク・比較できる実験的ツールだ。対象モデルのパラメータ数は25Mから360Mで、GPT-4やClaudeのようなフロンティアモデルとは対照的に、エッジデバイス向けの高速・軽量処理を目的としている。
技術的な核心はQ4量子化(4ビット量子化)にある。重みを16ビット浮動小数点から4ビットへ圧縮することでメモリ使用量を約75%削減し、100M超のモデルでもブラウザメモリ50〜84MB程度で動作する。生成品質への影響は最小限とされている。
WebGPUはW3C標準APIで、Apple Silicon(Metal)、DirectX 12、Vulkanなどハードウェアのネイティブシェーダーをブラウザから直接呼び出せる。これにより、time-to-first-tokenが10ms以下という超低遅延を実現している。
使い方は3ステップ。モデルをロードするとブラウザのIndexedDBにキャッシュされ(ディスクへのファイル保存なし)、チャットパネルでon-deviceテストができる。さらにBenchmarksタブでは速度・精度の客観テストを実行し、「パフォーマンス証明書」を生成してXやLinkedInでシェアする機能も備える。
ユースケースとして挙げられているのは、クエリ分類・スパムフィルタリング・意図抽出など「高コストなクラウドLLMが必要か判断するトリアージ層」としての活用だ。プロンプトやユーザーデータは一切デバイス外に出ない点を強調している。カスタムベンチマークをJavaScriptで記述できる機能も搭載されている。