Inception Labs lance Mercury 2.5, LLM de diffusion
Original : Mercury 2.5
Pourquoi c'est important
Mercury 2.5 démontre la maturité rapide des architectures dLLM pour des usages voix et agents en production.
Inception Labs a lancé Mercury 2.5, son modèle de diffusion linguistique le plus avancé. Il offre 40 % de gain d'intelligence par rapport à Mercury 2, 1 107 tokens/seconde, un contexte de 260 000 tokens, et un prix de lancement à 0,04 $ par million de tokens en entrée.
Inception Labs a publié Mercury 2.5, présenté comme le plus grand modèle de langage par diffusion (dLLM) jamais entraîné. Par rapport à Mercury 2, il affiche une amélioration de 40 % en qualité, des performances comparables aux modèles frontier optimisés pour les coûts tels que GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite et Claude Haiku 4.5. La vitesse atteint 1 107 tokens par seconde sur des GPU NVIDIA courants, avec une fenêtre de contexte de 260 000 tokens. Le prix standard est de 0,20 $ par million de tokens en entrée et 0,75 $ en sortie, mais réduit de 80 % au lancement (0,04 $ / 0,15 $).
En production, Mercury est déjà utilisé dans des cas d'usage exigeants : chez OpenCall, la latence médiane des réponses vocales est descendue à 170 ms, et le P99 est passé de « plusieurs minutes » à une seconde. Augment Code a réduit la latence de compaction de contexte de 82 % (de ~150 s à 27 s) et les coûts de 90 % grâce à Mercury. Inception Labs annonce également en preview Mercury Voice (TTFT < 170 ms) et Mercury Router.