Cerebras पर Qwen 3.8 27B उपलब्ध, 1500 टोकन/सेकंड
मूल शीर्षक: Qwen 3.8 27B available on Cerebras at 1500 tokens/s
यह क्यों महत्वपूर्ण है
Qwen 3.8 27B का 1500 tokens/s पर उपलब्ध होना open-source LLM inference के क्षेत्र में उच्च-गति production deployment की दिशा में महत्वपूर्ण कदम है।
Cerebras ने अपने सार्वजनिक Inference endpoint पर Qwen 3.8 27B मॉडल उपलब्ध कराया है। यह मॉडल 27 अरब parameters के साथ लगभग 1500 tokens/s की गति से काम करता है और free trial तथा pay-as-you-go दोनों tier पर उपलब्ध है।
Cerebras Inference ने अपने सार्वजनिक Model Catalog में Qwen 3.8 27B (Model ID: qwen-3.8-27b) को जोड़ा है। यह मॉडल 27 अरब parameters के साथ आता है और लगभग 1500 tokens प्रति सेकंड की inference गति प्रदान करता है। Context window free tier पर 64k और paid tier पर 128k tokens का है।
इसके साथ Catalog में OpenAI GPT OSS (gpt-oss-120b) भी उपलब्ध है, जो 120 अरब parameters के साथ ~3000 tokens/s की गति से काम करता है और free tier पर 65k तथा paid tier पर 131k context window देता है।
Model Compression पारदर्शिता के संदर्भ में Cerebras ने स्पष्ट किया है कि public endpoints पर सभी मॉडल unpruned और original versions हैं। Storage के दौरान selective weight-only quantization (16-bit / 8-bit / 4-bit) का उपयोग किया जाता है, लेकिन activations, attention और KV cache पूरी precision में रहते हैं। Cerebras ने REAP (Router-weighted Expert Activation Pruning) नामक pruning तकनीक पर शोध किया है, जिसके मॉडल Hugging Face पर उपलब्ध हैं, परंतु production API में नहीं हैं। कंपनी ने यह भी वचन दिया है कि बिना सूचना के किसी endpoint का architecture नहीं बदला जाएगा।