Fireworks、トークン40%削減の推論モデルEmber-1を公開
Judul asli: Ember-1
Mengapa Ini Penting
推論コスト削減は大規模エージェント開発の現実的な障壁であり、品質維持との両立モデルは業界の注目点
Fireworks AIが2026年9月23日、Kimi K3ベースの新モデルEmber-1を発表。同品質を維持しながらトークン使用量を40%削減。50回以上の学習実験と200回超の評価を経て開発。
Fireworks Researchが発表したEmber-1は、Moonshot AIのKimi K3をベースに構築された特化型モデルで、推論の質を落とさずにトークン消費を40%削減することを目的として開発された。
開発の背景には、K3のコーディング能力を使いたいが、長大な推論トレースによりコストが膨らむという開発者からの声があった。単純に推論量を下げる設定では品質が大きく低下したため、チームはモデル自体を再学習させる方針を選択。50回超の学習実験と200回以上の評価を実施し、新しい学習アルゴリズムも開発した。
Fireworks社内のServerlessトレーニング基盤を活用することでGPUのプロビジョニング不要で実験を即時起動でき、研究から製品化までの時間とコストを大幅に短縮したという。学習には自社データのみを使用し、顧客データは一切使っていないと明記している。
検証はSpeicialized Intelligence Index、外部ベンチマーク、実際の顧客A/Bテスト、そして社内の開発者によるコーディング・エージェント業務で実施。いずれの環境でも品質の低下は確認されなかったとしている。特にマルチターンのエージェント処理では、長い推論トレースが繰り返し再読み込みされるためコスト増加が深刻になりやすく、Ember-1のトークン削減効果が大きいと強調した。
Ember-1はFireworks Researchが展開する特化型モデルシリーズの第一弾として位置づけられており、本日より利用可能。