Kimi K3とFableの組み合わせが最高精度を達成

मूल शीर्षक: Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

यह क्यों महत्वपूर्ण है

オープンモデルとクローズドモデルのルーティング戦略が、単一モデル利用を超える精度とコスト削減を両立できることを実証したデータとして業界に示した点で重要。

Fireworks AIは2026年7月21日、Kimi K3(オープンモデル)とFable 5(クローズドモデル)を約1,030件のエージェントタスクで比較評価した結果を発表。ルーティングにより93%の精度を達成し、コストをFable単独比で最大50倍削減できることが示された。

Fireworks AIは、Kimi K3とFable 5を5種類のベンチマーク(SWE、Terminal、Algorithmic、Multi-Language、Legal)合計約1,030タスクで評価した結果を公開した。

主要な比較結果として、SWEベンチマークではKimi K3が92.4%、Fable 5が92.6%とほぼ同等の性能を示した。全カテゴリ平均でも両モデルは数ポイント以内の差にとどまり、Fable 5がMulti-Language(多言語対応)でやや優位に立った。

一方、タスク種別ごとに見ると得意分野が異なることが判明した。Kimi K3はシンボリック数学・開発ツール・JavaScript・Rustで優れた結果を示し、Fable 5はWebおよびデータビジュアライゼーション・Java・Python・C++で強みを発揮した。長時間にわたるTerminal操作においてもKimi K3は競争力を持つ。

Oracle Routing(最適モデルを事後的に選択する理論上限の測定手法)によれば、72〜96%のタスクでKimi K3が選択された。これは日常業務と高難度のフロンティアタスクの違いを学習することで、ほぼ完全なルーターの実現可能性を示唆するという。実際のルーターでは複数モデルを同時実行せず予測によってモデルを選択するため、精度向上にはさらに1桁多いルーティングデータが必要とされる。

コスト面では、Fireworks AI上でのKimi K3はFable 5と比較して最大50倍低コストで利用可能とされており、長いエージェントループを含むすべてのユースケースで一貫してコスト優位性があるとしている。

स्रोत

fireworks.ai — मूल लेख पढ़ें →