7種の小型LLMをブラウザで試せる実験ラボ公開

原題: MicroLLM Lab – Try 7 tiny LLM's in the browser

なぜ重要か

エッジAIの実用性をブラウザだけで検証できる環境が整ったことで、SLMの採用コストが大幅に下がる可能性がある。

stateofutopia.comは、25M〜360MパラメータのSmall Language Model(SLM)7種をブラウザ上で動作・比較できる実験環境「MicroLLM Lab」を公開した。WebGPUとQ4量子化を活用し、モデルはIndexedDBにキャッシュされ、ユーザーのデータは一切外部に送信されない。サーバーコストもアカウント登録も不要で、ベンチマーク結果の共有証明書も発行できる。

「MicroLLM Lab」は、GPT-4やClaudeのようなフロンティアモデルに頼らず、軽量なSLMをエッジデバイス上で実行することを目的とした検証ツールだ。対象モデルのパラメータ数は25Mから360Mで、Q4量子化(重みを16ビット浮動小数点から4ビットに圧縮)により、メモリ使用量を最大75%削減。100M超のモデルでもブラウザメモリ50〜84MB程度に収まる。

動作の要となるのはWebGPU——W3C標準のAPIで、Apple SiliconのMetal、DirectX 12、Vulkanといったハードウェアのシェーダーをブラウザから直接呼び出せる。初回トークン生成までの時間は10ms以下を目標とし、リアルタイムのオートコンプリートやエージェント処理への活用を想定している。

使い方は3ステップ。まずモデルカードの「Load」をクリックするとブラウザのIndexedDBにキャッシュされ、ディスクへのダウンロードは発生しない。次にChatパネルでプロンプトを入力し、tok/sのリアルタイム速度を確認。さらにBenchmarksタブでは、正規表現や完全一致トークンによる客観的な精度テストを実行でき、256トークンの持続デコード速度も計測できる。ベンチマーク結果はデバイス情報とともに証明書として画像出力し、XやLinkedInで共有することも可能だ。

SLMの主な用途として、クエリの分類・スパムフィルタリング・意図抽出が挙げられており、高コストなクラウドLLMへの問い合わせが本当に必要かを判断するトリアージ層としての活用が中心となる。カスタム評価のJavaScriptコードをeval()で実行できる機能も備えており、開発者向けの柔軟な拡張性も持つ。

出典

stateofutopia.com — 元記事を読む →