Fermion Research का Neutrino-1 8B मॉडल लॉन्च

मूल शीर्षक: Neutrino-1 8B

यह क्यों महत्वपूर्ण है

अत्यंत कम मेमोरी फुटप्रिंट के साथ edge और consumer hardware पर LLM deployment को व्यावहारिक बनाने की नई दिशा प्रस्तुत करता है।

Fermion Research ने 2025 जुलाई 27 को Neutrino-1 8B लॉन्च किया। यह 8.19B-parameter का decoder-only transformer है जो 3.88 GB की एक फाइल में उपलब्ध है। MMLU स्कोर 72.1 है और H100 पर 763 tok/s की स्पीड मिलती है।

Fermion Research ने Neutrino-1 8B मॉडल जारी किया है, जो Neutrino फैमिली का प्रमुख मॉडल है। इसकी सबसे बड़ी विशेषता यह है कि यह एक proprietary ternary-family weight format का उपयोग करता है, जो fp16 से 8 गुना छोटा है। इस कारण डाउनलोड साइज़ केवल 2.56 GB (lossless) है।

आर्किटेक्चर के अनुसार, मॉडल में 36 decoder layers, 4,096 hidden width, और grouped-query attention (32 query heads, 8 key-value heads) शामिल हैं। Context length 40,960 tokens है और vocabulary size 151,936 है। Base model Alibaba Cloud का Qwen3-8B है और लाइसेंस Apache-2.0 है।

मॉडल की 252 transformer linear layers coded ternary-family format में हैं, जो फाइल का 67.2% हिस्सा हैं। Token embeddings int8 फॉर्मेट में हैं। 6.95B coded weights में से 62.63% zero पर हैं।

यह मॉडल एक ही container से datacenter GPU (H100), MacBook, और desktop CPU पर बिना conversion के चलाया जा सकता है। 4k-token session के लिए KV cache केवल 1.21 GB है, जिससे पूरा मॉडल 8 GB GPU या 16 GB laptop पर fit हो जाता है। H100 पर speculative decoding के साथ 763 tok/s की थ्रूपुट प्राप्त होती है।

स्रोत

fermionresearch.com — मूल लेख पढ़ें →