Ollaya: लोकल में चलाएं Decision Models

मूल शीर्षक: Ollaya – Ollama for open-source, Jev-style decision models

यह क्यों महत्वपूर्ण है

Decision model inference को milliseconds में लोकल पर चलाना agent pipelines की latency और privacy दोनों समस्याओं को एक साथ हल करता है।

Ollaya एक open-source रनटाइम है जो Ollama की तरह decision models को लोकल hardware पर चलाता है। RTX 4090 पर Laya model पाँच सवालों का जवाब 8–10 ms में देता है। TypeSafe के Python SDK के साथ drop-in compatible है।

Ollaya एक beta-stage tool है जो Ollama से प्रेरित होकर decision models को उपयोगकर्ता के अपने hardware पर चलाने की सुविधा देता है। यह TypeSafe की API के साथ पूरी तरह compatible है — /v1/systemone और /v1/models endpoints TypeSafe के request/response format को follow करते हैं। TypeSafe का official Python SDK 0.7.1 बिना किसी बदलाव के local server पर काम करता है।

गति के मामले में Ollaya उल्लेखनीय है। RTX 4090 पर laya:multilingual model 8.1 ms में जवाब देता है, जबकि TypeSafe के hosted API की median latency 236–276 ms है। यह अंतर network overhead को हटाने से आता है, क्योंकि decision models token-by-token generation नहीं करते — एक ही forward pass में जवाब मिलता है।

Ollaya में कई open-weight models उपलब्ध हैं। Convai Innovations का Laya मॉडल English और 100+ भाषाओं में choice, score तथा yes/no सवालों के calibrated जवाब देता है (322M और 421M parameters)। Mapika का Decider, Qwen3.5 पर आधारित decoder model है जो option-letter logits से जवाब निकालता है (0.75B और 1.9B)। Moritz Laurer का NLI zero-shot classifier, Knowledgator का GLIClass, Qwen team का Qwen3Guard (119 भाषाओं में safety classification), और Jared Palmer का Kev भी उपलब्ध हैं।

यह tool उन developers के लिए है जो AI-driven decision-making को अपने infrastructure में private रखना चाहते हैं — user data किसी third-party server पर नहीं जाता।

स्रोत

ollaya.dev — मूल लेख पढ़ें →