0.8Bの高速判断モデル「Jeff」公開

원제: Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

왜 중요한가

小型・高速・ローカル動作という三拍子が揃った分類特化モデルは、エッジ推論やプライバシー重視アプリの選択肢を広げる。

開発者のfirelexa氏が2025年、Qwen3.5とGemma 4をベースにファインチューニングしたゼロショット分類モデル「Jeff」をGitHubで公開した。RTX PRO 6000で約22ms、Apple M4 Maxで約28msという低レイテンシで動作し、パラメータ数は0.8Bと小型。Jev互換のリクエスト形式を採用し、ローカル環境への組み込みを想定して設計されている。

「Jeff」はQwen3.5とGemma 4をベースに、ゼロショット分類専用にファインチューニングした小型モデルだ。テキスト生成や出力パースは行わず、1回のフォワードパスで各選択肢に対するキャリブレーション済み確率を直接返す。この設計がレイテンシを22〜28ms台に抑える要因となっている。

リクエスト形式はJev互換で、状況説明と選択肢をプレーンテキストで渡すだけでよい。サポートキューの振り分け、ユーザーインテント分類、モデレーションラベリング、音声コマンド認識、ゲームの手選択など、幅広いユースケースを想定している。カテゴリが学習データに含まれている必要はなく、記述するだけでモデルが判断する点がゼロショットの利点だ。

開発者自身が「非常に小型のモデル」と明言しており、大規模モデルのJevと推論品質で競合するものではないと位置付ける。一方、自前データでのファインチューニング効果は顕著で、音声ナビゲーションタスクでは1台のGPUで30分未満のファインチューニングにより、保留データでの精度が31.7%から95.8%へと大幅に向上した事例を公開している。すべてローカルハードウェアで構築・訓練されており、クラウド依存なしに本番環境へ組み込める点を強調している。GitHubのスター数はすでに229を超えた。

출처

github.com — 원문 읽기 →