0.8B軽量判断モデル「Jeff」、約30msで動作

原題: Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

なぜ重要か

エッジやオンプレ環境で低レイテンシの意図分類が求められるAIアプリ開発において、軽量ファインチューニング可能モデルの選択肢が広がりつつある。

オープンソースプロジェクト「Jeff」がGitHubで公開された。Qwen3.5およびGemma 4をベースにファインチューニングした0.8Bパラメータのゼロショット分類モデルで、RTX PRO 6000で約22ms、Apple M4 Maxで約28msという推論速度を実現。ローカルハードウェアのみで動作し、Jev互換のリクエスト形式に対応する。

「Jeff」は、firelexがGitHub上で公開したゼロショット分類特化の小型モデル群だ。Qwen3.5とGemma 4のファインチューニングにより生成されており、モデルサイズは0.8Bパラメータ。単一フォワードパスで各選択肢の較正済み確率を返す設計のため、テキスト生成もパース処理も不要という。

動作速度はRTX PRO 6000で約22ms、Apple M4 Max(MLX)で約28ms。コードへの組み込みはJev(別の既存分類ツール)と同一のリクエスト形式を踏襲しており、既存のJevユーザーにとって移行コストが低い点も特徴だ。

ゼロショットという設計上、サポートキューの振り分け、ユーザーインテントの識別、モデレーションラベリング、音声コマンド認識、ゲームの行動選択など、任意のカテゴリに対応できる。訓練データにカテゴリが含まれている必要はなく、ユーザーが自然言語で状況と選択肢を記述するだけでよい。

プロジェクトページでは、このモデルの限界についても率直に記載している。「非常に小さいモデルであり、より大規模なモデルで動作するJevの推論能力には及ばない」と明示。ただし、用途に応じてファインチューニングを加えることで性能は大幅に向上する。実際に音声ナビゲーション向けのファインチューニングでは、ホールドアウト精度が31.7%から95.8%へと改善し、所要時間は1台のGPUで30分以内だったと報告している。

ローカルハードウェア完結で動作する点も訴求ポイントだ。外部APIへの依存なしに、自社インフラや個人の開発環境で完結する軽量な判断レイヤーとして活用できる。スター数は229(公開時点)で、フォークも6件確認されている。

出典

github.com — 元記事を読む →