Créer son propre modèle de décision

Original : Build your own decision model

Pourquoi c'est important

L'inférence à passage unique réduit drastiquement les coûts pour les tâches de classification.

Un développeur explique comment construire un modèle de décision rapide avec un LLM contraint, en utilisant Qwen3-1.7B pour répondre à des QCM en un seul passage d'inférence, contre 11 pour un modèle standard.

Les modèles de langage classiques génèrent leurs réponses token par token : pour produire un JSON de 11 tokens, il faut 11 passes d'inférence. Les « decision models », comme Jev, adoptent une approche radicalement différente. En contraignant le vocabulaire aux seules options possibles (A, B, C, D, E), le modèle effectue un unique passage et sélectionne le token de plus haute probabilité.

Nish Tahir propose une implémentation concrète avec Qwen/Qwen3-1.7B via Hugging Face Transformers. Le principe : extraire les logits du dernier token, les masquer pour ne garder que les tokens correspondant aux options, puis appliquer un softmax. Sur la question « De quelle couleur est le ciel ? », le modèle attribue 99,88 % de probabilité à « Blue ».

Testé sur un échantillon aléatoire de CommonsenseQA, le modèle affiche des scores F1 entre 0,59 et 0,64 selon les options. L'auteur souligne une limite importante : les probabilités en sortie reflètent la confiance du modèle sur le prochain token, pas la probabilité réelle que la réponse soit correcte — sans fine-tuning dédié, ces scores ne valent pas comme indicateurs de fiabilité.

Source

nishtahir.com — Lire l'original →