7つの小型LLMをブラウザで試せるMicroLLM Lab公開

원제: MicroLLM Lab – Try 7 tiny LLM's in the browser

왜 중요한가

エッジAIの実用性を誰でも手元で検証できる環境が整い、クラウドLLM依存からの分散化が加速する可能性を示している。

stateofutopia.comが「MicroLLM Lab」を公開した。WebGPUを活用し、25M〜360Mパラメータの小型言語モデル(SLM)7種をブラウザ上で動作・ベンチマーク・比較できる無料ツール。Q4量子化によりモデルサイズを50〜84MBに圧縮し、サーバー不要・ゼロコスト・完全プライベートで利用可能。

MicroLLM Labは、WebGPUを使ってブラウザ内でSLMを完全オンデバイス実行できる実験的プラットフォームだ。アカウント登録不要、APIコストゼロ、ユーザーのプロンプトデータは一切外部に送信されない。

対象モデルは25M〜360Mパラメータの7種。4ビット量子化(Q4)によりウェイトのメモリフットプリントを約75%削減し、100M超のモデルでもブラウザのIndexedDBキャッシュに50〜84MB程度で収まる。初回ロード後はブラウザにキャッシュされるため、ディスクへのファイル保存も不要だ。

最大の特徴は「time-to-first-token 10ms以下」とされる応答速度。クエリのスパムフィルタリング、意図抽出、タスクルーティングといった軽量処理を端末側で完結させ、必要な場合にのみGPT-4やClaudeなどのクラウドLLMへ転送する「エッジ層」として機能することを想定している。

ベンチマーク機能では正規表現・完全一致トークンによる客観的な精度テストと、256トークン連続デコードの速度テストを実行可能。結果は「Performance Certificate」としてPNG画像で出力でき、XやLinkedInでの共有にも対応する。JavaScriptでカスタムベンチマークを記述する機能も備える。

WebGPUはW3C標準APIで、Apple Silicon(Metal)、DirectX 12、Vulkanをブラウザ経由で直接呼び出す。対応ブラウザが整備された現在、クライアントGPUを活用した「サーバーレスAI」の現実的な選択肢として注目される。

출처

stateofutopia.com — 원문 읽기 →