Kimi K3+Fableルーティングで最高精度93%達成

원제: Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

왜 중요한가

オープン・クローズドモデルのルーティング戦略が、単一モデル運用を上回るコスト効率と精度を実証し、エンタープライズAI導入の設計指針に影響を与える。

Fireworks AIは2026年7月21日、オープンモデル「Kimi K3」とクローズドモデル「Fable 5」を約1,030件のエージェントタスクで比較検証した結果を公開した。ルーティング併用により93%の精度を達成し、コストはFable単独比で最大50倍低減できることが示された。

Fireworks AIは、Kimi K3(オープンモデル)とFable 5(クローズドモデル)を5カテゴリ・約1,030タスクで評価した結果を発表した。テスト内訳はSWEベンチマーク460件、ターミナル操作89件、アルゴリズム問題100件、多言語実装225件、法律エージェント120件。

主要指標のSWEではKimi K3が92.4%、Fable 5が92.6%とほぼ同等。一方、タスク種別ごとに得意分野が異なり、K3はシンボリック数学・開発ツール系で優位、Fable 5はWebやデータビジュアライゼーション、Java・Python・C++の多言語実装で強みを発揮する。JavaScriptとRustではK3が同等水準に達した。

オラクルルーティング(各モデルを実行し最安かつ正解の選択肢を選ぶ理論値測定)では、K3が72〜96%のタスクで選択された。実際のルーティングではモデルを事前に予測して割り振るため精度は低下するが、今回の検証では93%の正答率を達成。コスト面では長期エージェントループにおいてFable単独比で最大約50倍の削減効果が確認された。

Fireworks AIは「単一モデルの時代は終わり、ルーティングがコストと品質を両立する標準手法になる」と主張。さらなる精度向上には大規模なルーティングデータと実運用フィードバックが必要としている。

출처

fireworks.ai — 원문 읽기 →