Ollaya: 意思決定モデルをローカル実行
원제: Ollaya – Ollama for open-source, Jev-style decision models
왜 중요한가
LLMの推論コストに敏感なエージェント開発者に、完全ローカルで動作する高速意思決定モデルの選択肢が生まれたことはインフラ設計の幅を広げる。
オープンソースプロジェクト「Ollaya」が公開された。テキストやJSONに対して型付き質問を投げると、トークン生成なしの単一フォワードパスで確率付き回答を返す意思決定モデルをローカルGPU上で動作させる。RTX 4090での実測レイテンシは5問のリクエストに対してエンドツーエンド8〜10ミリ秒。TypeSafe(旧Jev)の公式Python SDK 0.7.1との互換性も確認済み。
Ollayaは、いわば「意思決定モデル版Ollama」だ。テキストやJSONを入力として受け取り、choice・score・yes/noといった型付き質問に確率値付きで答える推論専用モデルを、ユーザー自身のハードウェア上でプライベートに実行できる。
最大の特徴は速度だ。通常の大規模言語モデルと異なり、トークンを逐次生成せず単一フォワードパスで回答を出力するため、NVIDIA RTX 4090上でHTTP APIを経由した5問リクエストに対し8.1〜9.6ミリ秒という低レイテンシを実現している。TypeSafe(TypeSafe Jev)のホスト型APIの中央値が236〜276ミリ秒(ネットワーク込み)であることを踏まえると、オーダーが1桁違う。
現時点でサポートするモデルは複数ある。Convai Innovationsが開発したエンコーダ系「Laya」(英語専用322Mと100言語以上対応421M)、Qwen3.5ベースのデコーダ系「decider」(0.75B・1.9B)、Moritz Laurer製のゼロショット分類器「nli」、KnowledgatorのGLiClass、QwenチームのQwen3guard(119言語対応安全判定)、そしてJared Palmer製のLoRA系「kev」と、多様な選択肢を用意している。
APIはTypeSafeの `/v1/systemone` エンドポイントと互換性を持ち、SDKの接続先を `localhost:11435` に変えるだけで既存コードをそのまま流用できる。データは外部に送信されないため、企業の機密テキスト処理や自律エージェントの判断ロジックへの組み込みを想定したユースケースで有効だ。