Ember-1:推論トークンを40%削減
원제: Ember-1
왜 중요한가
推論モデルの過剰思考問題に対し「再トレーニング」という手法で正面突破した点は、コスト最適化の新たなアプローチとして業界全体に影響を与え得る。
Fireworks AIは2026年9月23日、Kimi K3ベースの新モデル「Ember-1」を公開した。同モデルは50回以上のトレーニング実験と200回以上の評価を経て開発され、Kimi K3と同等の品質を維持しながらトークン使用量を40%削減することに成功。本日より提供開始となった。
Fireworks Researchが開発した「Ember-1」は、Moonshot AIのKimi K3をベースに、不要な推論ステップを削減するよう再トレーニングされた特化型モデルだ。
開発の背景にあったのは、思考系モデルが抱える構造的な問題だった。Kimi K3のような推論モデルは、生成トークンの90%以上を内部思考に費やすケースもある。マルチターンのエージェント型ワークロードでは、各ターンごとに過去の推論が再読み込みされるため、コンテキスト長がターン数の二乗に比例して膨張し、コストが急増する。
FireworksチームはKimi K3の推論の多くが「過剰」であることを実験で確認。回答の質を損なわずに削除できる余剰推論を取り除く新しいトレーニングアルゴリズムを開発した。実験回数は50回超、評価は200回以上に及ぶ。
開発にはFireworks Serverless Trainingを活用。GPUのプロビジョニングや管理が不要なため、アイデアが出た即座に実験を開始でき、研究から製品化までのリードタイムとコストを大幅に圧縮できたとしている。
品質検証は外部ベンチマーク、社内開発者によるA/Bテスト、顧客向けライブA/Bテストの三段階で実施。いずれの環境でも品質低下は確認されなかったという。トレーニングには自社データのみを使用し、顧客データは一切使っていないと明示している。
Ember-1はFireworks Researchが展開する特化型モデルシリーズの第一弾と位置づけられており、今後も継続的にリリースが予定されている。