Dust: Melatih Transformer Tanpa Backpropagation

Judul asli: Dust: Pretraining Transformers Without Backpropagation

Mengapa Ini Penting

Alternatif backprop yang skalabel membuka peluang arsitektur dan hardware baru di luar batasan diferensiabilitas.

Q Labs merilis riset Dust, metode zeroth-order pertama yang kompetitif dengan backprop untuk pretraining transformer, menggunakan perturbasi aktivasi paralel per token.

Tim peneliti Q Labs — Samip Dahal, Bishwas Mandal, Serdar Gülbahar, dan Akshay Vegesna — mempublikasikan makalah 'Dust' pada Oktober 2026, mengklaim pencapaian pertama: metode zeroth-order yang dapat bersaing dengan backpropagation dalam pretraining language model berbasis transformer.

Dust bekerja dengan memperturb aktivasi (bukan bobot) secara independen di setiap token. Hasilnya, setiap token menjadi anggota populasi virtual yang bisa dievaluasi sekaligus dalam satu forward pass — tanpa backward pass sama sekali.

Temuan paling mengejutkan: model lebih besar justru lebih efisien dalam penggunaan populasi, bukan sebaliknya. Model 243 juta parameter mengungguli model 120 kali lebih kecil di hampir semua ukuran populasi. Ini secara langsung menantang keyakinan lama bahwa metode zeroth-order tidak bisa diskalakan ke jaringan besar.

Dibandingkan EGGROLL, metode evolutionary strategy (ES) mutakhir berbasis transformer, Dust diklaim 10³ hingga 10⁴ kali lebih efisien mulai dari 1 juta token. Estimasi gradien Dust juga semakin selaras dengan backprop seiring bertambahnya populasi, dan tetap terjaga hingga skala 1 miliar token.

Sumber

qlabs.sh — Baca artikel asli →