Inception Labs का Mercury 2.5 लॉन्च

मूल शीर्षक: Mercury 2.5

यह क्यों महत्वपूर्ण है

Diffusion-आधारित LLM architecture का production-grade maturity, low-latency AI applications के लिए नई संभावनाएँ खोलता है।

Inception Labsने बुधवार को अपना नया diffusion LLM मॉडल Mercury 2.5 जारी किया। यह Mercury 2 की तुलना में 40% अधिक intelligent है, 1,107 tokens प्रति सेकंड की speed प्रदान करता है, और 260K tokens का context window रखता है। लॉन्च मूल्य $0.04 प्रति मिलियन input token है।

Inception Labs के CEO Stefano Ermon ने Mercury 2.5 को कंपनी का अब तक का सबसे सक्षम production मॉडल बताया। उनके अनुसार यह बाज़ार में उपलब्ध सबसे बड़ा diffusion language model है।

**मुख्य विशेषताएँ:**

- गुणवत्ता: Mercury 2 से 40% अधिक intelligence, GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite और Claude Haiku 4.5 जैसे cost-optimized frontier मॉडलों के बराबर

- गति: NVIDIA GPU पर 1,107 tokens प्रति सेकंड

- Context: 260K tokens

- सामान्य मूल्य: $0.20 प्रति मिलियन input, $0.75 प्रति मिलियन output; लॉन्च ऑफर पर 80% छूट के साथ $0.04/$0.15

**Production उपयोग के उदाहरण:**

Voice agent कंपनी OpenCall के CEO Oliver Silverstein के अनुसार, Mercury अपनाने के बाद उनका P99 response time कई मिनट से घटकर सिर्फ 1 सेकंड और P50 response time 0.4 सेकंड से 0.2 सेकंड से कम हो गया। Augment Code ने Mercury को context compaction में उपयोग किया, जिससे latency 82% (लगभग 150 सेकंड से 27 सेकंड) और लागत 90% कम हुई।

इसके साथ ही कंपनी ने Mercury Voice (170ms से कम TTFT) और Mercury Router का preview भी घोषित किया है। NVIDIA की Senior Manager Shruti Koparkar ने NVIDIA AI infrastructure पर इस मॉडल की प्रगति की सराहना की।

स्रोत

inceptionlabs.ai — मूल लेख पढ़ें →