Jeff : modèles de décision 0,8B open source à ~30 ms

Original : Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms

Pourquoi c'est important

Un modèle de décision local sub-30 ms ouvre la voie à l'inférence temps réel sans dépendance cloud.

Firelex publie Jeff sur GitHub, une collection de fine-tunes de Qwen3.5 et Gemma 4 pour la classification zero-shot. Ces modèles de 0,8B paramètres répondent en 22 ms sur RTX PRO 6000 et 28 ms sur Apple M4 Max, sans génération de texte ni parsing.

Jeff est un projet open source qui propose des fine-tunes légers de Qwen3.5 et Gemma 4, spécialisés dans la classification zero-shot. Le principe est simple : l'utilisateur décrit une situation et liste des options en langage naturel ; le modèle retourne une probabilité calibrée pour chaque option en un seul passage (forward pass), sans produire de texte intermédiaire.

Les latences annoncées sont de 22 ms sur une carte NVIDIA RTX PRO 6000 et 28 ms sur un Apple M4 Max via MLX. Aucune infrastructure cloud n'est requise : tout tourne en local. Les catégories de classification peuvent être totalement inédites — files de support, intentions utilisateur, modération, commandes vocales, coups de jeu — sans figurer dans les données d'entraînement.

Sur les benchmarks, Jeff approche et parfois dépasse Jev, le modèle de référence de la famille, bien que ce dernier repose sur une architecture nettement plus grande et affiche un raisonnement supérieur. Pour les cas exigeants, un fine-tune rapide sur données propriétaires donne des résultats spectaculaires : la navigation vocale est passée de 31,7 % à 95,8 % de précision en moins de 30 minutes sur un seul GPU. Le projet compte déjà 229 étoiles sur GitHub.

Source

github.com — Lire l'original →