Inception Labs、Mercury 2.5を発表——最速拡散LLM
Judul asli: Mercury 2.5
Mengapa Ini Penting
拡散型LLMが低コスト・超低遅延でフロンティアモデルに匹敵し、音声・検索・コーディング領域での実用化が加速している点が業界的に注目される。
Inception Labsは拡散型言語モデル「Mercury 2.5」をリリース。速度1,107トークン/秒、コンテキスト260Kトークン、価格は入力$0.04/百万トークン(80%オフ)。
Inception Labsは2025年、同社の最新プロダクションモデル「Mercury 2.5」を公開した。Mercury 2比で知能品質が40%向上し、GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5など低コスト最前線モデルと同等の性能を持つとされる。同社によれば、これまでに訓練された最大規模の拡散型言語モデル(dLLM)だという。
処理速度はNVIDIA GPUで毎秒1,107トークン、コンテキストウィンドウは260Kトークン。通常価格は入力$0.20/百万トークン・出力$0.75/百万トークンだが、ローンチ時は80%割引の入力$0.04・出力$0.15で提供される。
実際の導入事例として、AIフォンエージェント企業OpenCallはMercury導入後、P99レスポンスタイムを数分から1秒以下に短縮、P50は0.4秒から0.2秒未満に改善したと報告。コーディング支援ツールのAugment Codeはコンテキスト圧縮にMercuryを採用し、レイテンシを約150秒から27秒へ82%削減、コストも90%削減した。
また、音声エージェント向け「Mercury Voice」とルーティング最適化の「Mercury Router」のプレビューも同時発表。Mercury Voiceは初回トークン生成時間(TTFT)170ミリ秒未満を実現する。