Qwen3.8-2.4T-A95B: नया विशाल AI मॉडल Hugging Face पर उपलब्ध
मूल शीर्षक: Qwen3.8-2.4T
यह क्यों महत्वपूर्ण है
2.4T पैरामीटर का open-weight MoE मॉडल जारी होने से बड़े AI मॉडलों की ओपन-सोर्स पहुँच का दायरा और बढ़ता है।
Alibaba के Qwen टीम ने Qwen3.8-2.4T-A95B नामक एक बड़ा भाषा मॉडल Hugging Face प्लेटफ़ॉर्म पर जारी किया है। यह मॉडल 2.4 ट्रिलियन कुल पैरामीटर और 95 बिलियन सक्रिय पैरामीटर के साथ Mixture-of-Experts (MoE) आर्किटेक्चर पर आधारित है।
Alibaba Cloud की Qwen टीम ने Hugging Face पर Qwen3.8-2.4T-A95B मॉडल प्रकाशित किया है। इस मॉडल का पूरा नाम Qwen3 सीरीज़ का हिस्सा है और यह Mixture-of-Experts (MoE) तकनीक पर आधारित है, जिसमें कुल 2.4 ट्रिलियन पैरामीटर हैं, जबकि प्रत्येक इनफरेंस के दौरान केवल 95 बिलियन पैरामीटर सक्रिय रहते हैं।
मॉडल का chat template Tool Calling को सपोर्ट करता है, जिसमें structured XML फॉर्मेट में function call करने की क्षमता दी गई है। साथ ही, reasoning_instructions के माध्यम से thinking mode को नियंत्रित किया जा सकता है। यह मॉडल multi-turn conversation और system message को भी सही ढंग से संभालता है।
Qwen3 सीरीज़ के पिछले मॉडलों की तरह, यह भी open-weight फॉर्मेट में Hugging Face पर उपलब्ध कराया गया है, जिससे developers और researchers इसे डाउनलोड करके उपयोग कर सकते हैं। MoE आर्किटेक्चर के कारण यह मॉडल घने (dense) मॉडलों की तुलना में इनफरेंस के दौरान कम compute संसाधनों का उपयोग करता है।