Kimi K3 आर्किटेक्चर: 2.8T पैरामीटर का विश्लेषण
मूल शीर्षक: Kimi K3 Architecture Overview and Notes
यह क्यों महत्वपूर्ण है
2.8 ट्रिलियन पैरामीटर के साथ यह सबसे बड़ा open-weight मॉडल है, जो NoPE और LatentMoE जैसी नई efficiency तकनीकों को बड़े पैमाने पर लागू करता है।
AI शोधकर्ता Sebastian Raschka ने Moonshot AI के Kimi K3 मॉडल की आर्किटेक्चर का विस्तृत विश्लेषण प्रकाशित किया। Kimi K3 वर्तमान में 2.8 ट्रिलियन पैरामीटर के साथ दुनिया का सबसे बड़ा open-weight मॉडल है।
Sebastian Raschka ने अपने ब्लॉग में Kimi K3 की आर्किटेक्चर का तकनीकी विश्लेषण साझा किया है। Kimi K3 मूलतः Kimi Linear मॉडल का बड़े पैमाने पर विस्तार है, जो 48B पैरामीटर से बढ़कर 2.8 ट्रिलियन पैरामीटर तक पहुंचा है।
नई आर्किटेक्चर में प्रमुख घटक निम्नलिखित हैं:
**LatentMoE**: यह Nemotron 3 Ultra में उपयोग की गई तकनीक के समान है। इसमें बड़े linear layers को compress (down-project) किया जाता है, जो multi-head latent attention के समान सिद्धांत पर कार्य करती है।
**Inference Efficiency**: Kimi K3 का मुख्य फोकस inference दक्षता पर है। इसमें MoE को LatentMoE से, regular attention को multi-head latent attention और Kimi Delta Attention से बदला गया है।
**Attention Residuals**: यह घटक layers के बीच residuals को जोड़ता है और attention score के आधार पर योगदान का भार निर्धारित करता है। तकनीकी रिपोर्ट के अनुसार, इससे validation loss और downstream performance में सुधार होता है, हालांकि training cost में लगभग 4% और inference cost में 2% की वृद्धि होती है।
**NoPE (No Positional Embeddings)**: Kimi K3 ने सभी RoPE layers हटा दी हैं और पूरे मॉडल में NoPE का उपयोग किया है। यह frontier-level मॉडल में इस तरह का पहला प्रयोग बताया गया है।
इसके अतिरिक्त, Kimi K3 में native multimodal support भी जोड़ी गई है।