Ember-1:推論トークン40%削減モデル登場
原題: Ember-1
なぜ重要か
エージェント処理の普及でコスト増が深刻化する中、推論モデルのトークン効率化は業界全体の急務であり、専用チューニングという手法の有効性を示す先行事例として注目される。
Fireworks AIは2026年9月23日、独自の推論モデル「Ember-1」を公開した。Kimi K3をベースに50回以上のトレーニング実験と200回超の評価を経て開発。同等の回答品質を維持しながらトークン数を約40%削減することに成功した。ライブA/Bテストおよび社内コーディング・エージェント用途でも品質低下は確認されなかった。
Fireworks ResearchはKimi K3の高品質な推論能力を維持しつつ、生成トークン数を40%削減した専用モデル「Ember-1」を発表した。価格面のハードルが高かったK3のコーディング用途を想定したモデルで、本日より利用可能となっている。
開発の出発点は、思考モデルが持つ構造的な非効率性だ。Kimi K3のような推論モデルは、生成トークンの90%以上を最終的な回答ではなく内部推論に費やすことがある。単一リクエストでも高コストだが、マルチターンのエージェント処理ではさらに問題が深刻化する。各ターンで過去の推論全体がコンテキストとして再入力されるため、コストはターン数の二乗に比例して膨らむ仕組みだ。
Fireworksチームはこの過剰推論の多くが不要であると実験で確認。K3が出力する推論テキストはタスクが本来必要とする量より大幅に長く、余分な部分を取り除いても回答品質は変わらないという知見を得た。ただし、仮定の見直しやフィードバックへの対応といった「自己反省」的な推論は必要であり、取捨選択を学習させるためのトレーニングが不可欠だった。
開発プロセスでは50回以上のトレーニング実験と200回超の評価を実施。推論を短縮しながら精度を維持する独自アルゴリズムも新たに開発した。インフラにはFireworks Serverless Trainingを活用し、GPU調達・管理の手間を省くことで実験の即時開始とコスト最小化を両立。研究からリリースまでの時間と費用を大幅に圧縮したという。
学習データは自社データのみを使用し、顧客データは一切使っていないとFire worksは明言している。品質検証は外部ベンチマーク「Specialized Intelligence Index」、公開ベンチマーク、および実際の本番トラフィックを使ったA/Bテストで実施。社内の開発者が日常業務でEmber-1を使用しても品質の差に気付かなかったと報告されている。Ember-1はFireworks独自モデルシリーズの第一弾であり、今後も続く専用モデル展開の皮切りとなる。