Ollaya:ローカル実行の意思決定モデル基盤
原題: Ollaya – Ollama for open-source, Jev-style decision models
なぜ重要か
LLMに比べて推論コストが2桁低い意思決定モデルのローカル実行環境が整備されると、エージェント処理のコスト構造が大きく変わる可能性がある。
オープンソースプロジェクト「Ollaya」が公開された。テキストやJSONに対して型付きの質問を投げると、数ミリ秒で確率付き回答を返す「意思決定モデル」をローカルGPU上で動かすためのツールで、TypeSafe社のAPI仕様と互換性を持つ。NVIDIA RTX 4090上でのレイテンシは5問のリクエストでエンドツーエンド約8〜10ミリ秒とされる。
Ollayaは、分類・判定に特化した「意思決定モデル」をOllamaのように手元のハードウェアで実行するためのローカルサーバー基盤だ。トークンを1つずつ生成する通常の大規模言語モデルと異なり、単一のforward passで回答を出力するため、RTX 4090上で5問のリクエストをHTTP API経由でエンドツーエンド処理するのに要する時間はわずか8〜10ミリ秒。ホスト型サービス「TypeSafe Jev」が236〜276ミリ秒(ネットワーク込みのサードパーティ計測値)であるのと比べると、桁違いの速さとなる。
APIはTypeSafe社の`/v1/systemone`エンドポイントと互換性があり、公式PythonSDK(バージョン0.7.1)の接続先URLを変更するだけで既存コードをそのまま動かせる。回答形式は選択肢(choice)、スコア(score)、はい/いいえ(yes/no)の3種類に対応し、各選択肢の確率も返ってくる。
現時点で利用可能なモデルは複数ある。Convai Innovationsの「Laya」は英語版・多言語版(100言語以上)の2モデルで、パラメータ数は322M〜421M。Mapikaが開発した「decider」はQwen3.5ベースのデコーダ型モデルで0.75Bと1.9Bの2サイズがあり、Ollayaが提供するオープンモデルの中で最も高精度とされる。そのほか、Moritz Laurer製のゼロショット分類器「nli」、Knowledgator製の「gliclass」、Qwenチームのセーフティガード「qwen3guard」、Jared Palmer製の「kev」なども含まれる。
すべてのモデルはオープンウェイトで、ローカルにプルして使う設計。データは外部に送信されず、自社インフラ上で完結する点を開発側は強調している。現在はBeta版として公開されており、Ollayaのサイトからダウンロードが可能だ。