エージェント向け自己最適化推論エンジン「Magnitude」

원제: Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents

왜 중요한가

ローカル推論の高速化はAPIコスト削減とプライバシー確保の両面から注目度が高く、llama.cppの代替候補として市場での存在感が増す可能性がある。

YC S25採択のMagnitudeは、エージェント向けオープンソース推論エンジンをGitHubで公開した。デバイス上でカーネルをコンパイル・チューニングし、llama.cppと比較して最大2倍の推論速度を実現。Apple Silicon、NVIDIA、AMD、CPUのみの環境にも対応し、macOS・Windows・Linux向けアプリを提供している。

Magnitude(YC S25)は、AIエージェント向けに設計された自己最適化型のオープンソース推論エンジンだ。最大の特徴は、ユーザーの実機ハードウェアに合わせてカーネルをコンパイル・チューニングする点にある。これにより、広く使われているllama.cppと比較して最大2倍の推論速度を達成するとしている。

Apple Silicon(M系チップ)、NVIDIA GPU、AMD GPU、そしてGPUなしのCPU単体環境でも動作する。対応プラットフォームはmacOS、Windows、Linuxの3つ。Pi、OpenCode、Hermes、Codex(OpenAI製)など、既存のAIエージェントとワンクリックで連携できる設計になっており、既存ワークフローへの組み込みを意識している。

リポジトリはGitHubでApache-2.0ライセンスの下で公開されており、公開から短期間でスター数5,700超、フォーク数397を記録している。コード構成を見ると、`inference-v2`から`inference-v4`まで複数世代の推論エンジンが並存しており、開発が急速に進んでいることがうかがえる。

ローカル環境でのオープンモデル高速実行を求める開発者、特にエージェント用途でのレイテンシ削減を重視するユーザー層をターゲットにしている。

출처

github.com — 원문 읽기 →