RTX 4090 पर 125B मॉडल, 100 टोकन/सेकंड

मूल शीर्षक: Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

यह क्यों महत्वपूर्ण है

server-grade AI को consumer hardware पर लाने की कोशिश local AI inference की पहुँच बढ़ा सकती है।

Strata नामक open-source inference engine अब Qwen3.8-Flash-Next (125B parameters) को RTX 4090 जैसे consumer GPU पर 100 tokens/second की गति से चला सकता है। Windows और Linux दोनों पर one-click install उपलब्ध है।

GitHub पर Niko1221 द्वारा विकसित Strata project को अब तक 10,200 से अधिक Stars मिल चुके हैं और 906 Forks हैं — यह संख्या community की गहरी रुचि दर्शाती है। यह engine Qwen3.8-Flash-Next मॉडल को 12 GB या अधिक VRAM वाले किसी भी NVIDIA या AMD GPU पर चलाने में सक्षम है।

Strata, OpenAI और Anthropic-compatible API को localhost पर serve करता है, जिससे मौजूदा tools बिना बदलाव के काम करते हैं। Image input का optional support भी शामिल है। IQ3_S quantization के साथ 128K context window तक काम किया जा सकता है।

Project में ggml third-party library का उपयोग है और SYCL backend भी मौजूद है, जो Intel GPU support का संकेत देता है। README में RTX 5070 पर एक voxel pagoda garden का demo दिखाया गया है जो single prompt से generate हुआ। Project MIT license के तहत free और open source है।

125 billion parameter का मॉडल सामान्यतः बड़े data center servers पर चलता है। Strata इसे gaming PC तक लाने का दावा करता है — यही इसकी मुख्य विशेषता है।

स्रोत

github.com — मूल लेख पढ़ें →