Kimi K3とFableの組み合わせが最高精度を実現
Judul asli: Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
Mengapa Ini Penting
モデルルーティング戦略がAIエージェント開発のコスト最適化の主流になりつつあることを示す事例。
Fireworks AIがKimi K3とFable 5を約1,030件のエージェントタスクでテストし、ルーティング併用で93%の精度と最大50倍のコスト削減を確認した。
Fireworks AIは、オープンモデルのKimi K3とクローズドモデルのFable 5を約1,030件のエージェントタスクで比較評価した結果を発表した。評価はSWE(リポジトリのバグ修正460件)、Terminal(セキュリティ・暗号・システム管理89件)、Algorithmic(アルゴリズム問題100件)、Multi-Language(6言語実装225件)、Legal(法律エージェント120件)の5カテゴリで実施された。
SWEベンチマークではKimi K3が92.4%、Fable 5が92.6%とほぼ同等の結果を記録。両モデルは全体スコアが近似しているものの、得意分野が異なる。K3はシンボリック数学や開発ツール系で優位に立ち、FableはJava・Python・C++などの多言語対応やWeb・データ可視化で強みを発揮した。
Oracleルーティング(各モデルを実行し最もコスト効率の良い正解を選択する手法)を用いた場合、全タスクの72〜96%でK3が選択され、ルーティング全体で93%の精度を達成。長期エージェントループではFable単体比で最大50倍のコスト削減が確認された。Fireworks AIは「単一モデルの時代は終わり、タスクに応じたルーティングが最高の精度とコスト効率を実現する」と述べている。