Backprop बिना Transformer Training: Dust

मूल शीर्षक: Dust: Pretraining Transformers Without Backpropagation

यह क्यों महत्वपूर्ण है

यह शोध backprop पर AI training की निर्भरता को चुनौती देता है, जो नई architecture और hardware संभावनाएं खोल सकता है।

Q Labs के शोधकर्ताओं Samip Dahal और साथियों ने अक्टूबर 2026 में 'Dust' विधि प्रस्तुत की, जो backpropagation के बिना transformer language models को pretrain करती है और कई परीक्षणों में backprop से बेहतर प्रदर्शन करती है।

Q Labs के चार शोधकर्ताओं — Samip Dahal, Bishwas Mandal, Serdar Gülbahar और Akshay Vegesna — ने 'Dust' नामक zeroth-order विधि पेश की है। यह पहली ऐसी विधि है जो transformer pretraining में backpropagation से प्रतिस्पर्धा कर सके।

Dust की मुख्य तकनीक 'node perturbation' है — यह हर token पर activation space में स्वतंत्र रूप से perturbation करती है। इससे हर token एक virtual population member बन जाता है और सभी को एक ही forward pass में समानांतर evaluate किया जा सकता है। backward pass की ज़रूरत नहीं पड़ती।

दक्षता के मोर्चे पर यह विधि उल्लेखनीय है। Dust, weight-space Evolution Strategies (ES) से कई गुना अधिक कुशल है। 1 मिलियन tokens से आगे, यह state-of-the-art ES विधि EGGROLL के transformer implementation से 10³ से 10⁴ गुना तक अधिक efficient है — शोधकर्ताओं के अनुमान के अनुसार।

एक महत्वपूर्ण खोज यह भी है कि बड़े models इस विधि में अधिक population-efficient निकले, न कि कम। 243 मिलियन parameter वाला model, उससे 120 गुना छोटे model से अधिकतर population sizes पर बेहतर रहा। यह zeroth-order methods के बारे में प्रचलित धारणा को चुनौती देता है कि वे बड़े networks पर scale नहीं होते।

शोधकर्ताओं का तर्क है कि जैसे-जैसे compute बढ़ता है, differentiability और backprop जैसे inductive biases की ज़रूरत घट सकती है — ठीक वैसे जैसे AlphaGo Zero ने human data को पीछे छोड़ दिया था।

स्रोत

qlabs.sh — मूल लेख पढ़ें →