Ollaya : des modèles de décision open source en local
Original : Ollaya – Ollama for open-source, Jev-style decision models
Pourquoi c'est important
L'inférence locale de modèles de décision réduit coûts et latence pour les pipelines d'agents IA.
Ollaya est un outil open source inspiré d'Ollama permettant d'exécuter localement des modèles de décision typés (choix, score, oui/non). Compatible avec l'API TypeSafe, il répond en 8 à 10 ms sur GPU NVIDIA en un seul forward pass, sans génération token par token.
Ollaya se positionne comme l'équivalent d'Ollama pour les modèles de décision — ces modèles capables de répondre à des questions structurées sur du texte ou du JSON sans générer du texte libre. L'outil tourne entièrement en local, sur le matériel de l'utilisateur, sans envoyer de données à des serveurs tiers.
La vitesse est le principal argument : sur une RTX 4090, une requête de cinq questions via l'API HTTP prend entre 8 et 10 ms pour le modèle Laya, contre 236 à 276 ms pour l'API hébergée de TypeSafe (mesures tiers incluses). Le gain vient du design même des modèles : une seule passe vers l'avant suffit, sans décodage séquentiel.
Ollaya est compatible avec l'API TypeSafe — il expose les endpoints `/v1/systemone` et `/v1/models` avec les mêmes formats de requête et de réponse. Le SDK Python officiel TypeSafe 0.7.1 fonctionne sans modification en pointant vers le serveur local.
Plusieurs modèles sont disponibles : Laya (Convai Innovations, 322M–421M paramètres, 100+ langues), Decider (Mapika sur base Qwen3.5, 0.75B–1.9B, décrit comme le plus précis parmi les modèles open), NLI de Moritz Laurer, GLiClass de Knowledgator, Qwen3Guard pour la sécurité du contenu, et Kev de Jared Palmer. Tous les poids sont ouverts et téléchargeables directement.