Ember-1 : moitié moins de tokens, même qualité

Original : Ember-1

Pourquoi c'est important

Réduire le coût des modèles de raisonnement sans sacrifier la qualité est un enjeu majeur pour le déploiement à grande échelle.

Fireworks AI lance Ember-1, un modèle dérivé de Kimi K3 qui réduit de 40 % le nombre de tokens générés sans perte de qualité mesurable. Après 50 expériences d'entraînement et 200 évaluations, le modèle est disponible dès aujourd'hui sur la plateforme Fireworks Serverless Training.

Fireworks Research présente Ember-1, son premier modèle propriétaire issu d'une série dédiée aux développeurs. Le constat de départ est simple : les modèles de raisonnement comme Kimi K3 consacrent jusqu'à 90 % de leurs tokens générés à leur raisonnement interne, pas à la réponse finale. Dans des workflows agentiques multi-tours, le coût explose car chaque appel relit l'intégralité du contexte précédent, créant une croissance quasi quadratique.

Plutôt que de simplement baisser l'effort de raisonnement — solution qui dégradait la qualité —, l'équipe a entraîné le modèle à raisonner plus efficacement. Résultat : 40 % de tokens en moins pour une qualité équivalente à K3, validée sur des benchmarks publics, le Specialized Intelligence Index maison, et des A/B tests en production réelle.

L'entraînement a mobilisé plus de 50 expériences et 200 évaluations, entièrement réalisés sur Fireworks Serverless Training, sans données clients. Fireworks souligne que l'absence de gestion GPU a permis de passer de la recherche au lancement « en une fraction du temps et du coût habituels ». Ember-1 ouvre une ligne de modèles spécialisés, façonnés par les retours des développeurs.

Source

fireworks.ai — Lire l'original →