バックプロパゲーション不要のTransformer事前学習法「Dust」
原題: Dust: Pretraining Transformers Without Backpropagation
なぜ重要か
バックプロパゲーション不要の事前学習が実用規模で成立するなら、非微分可能アーキテクチャや専用ハードウェア設計の可能性が広がる。
Q Labsの研究者4名(Samip Dahal氏ら)は2026年10月、バックプロパゲーションを使わずにTransformer言語モデルを事前学習できるゼロ次最適化手法「Dust」を発表した。活性化空間への摂動(ノード摂動)を各トークンに独立して適用し、1回のフォワードパスで並列評価を実現。243Mパラメータモデルで、その120分の1のサイズのモデルを上回る性能を示した。
深層学習はこれまで、バックプロパゲーション(誤差逆伝播)なしに大規模ニューラルネットを訓練することは不可能とされてきた。Q Labsが発表した「Dust」はその常識に挑む手法だ。
Dustの核心は「活性化空間摂動」にある。各トークンに独立したノイズを加え、それぞれを仮想的な集団メンバーとして扱うことで、1回のフォワードパスで集団全体の評価を並列実行できる。従来の重み空間での進化戦略(ES)と比べ、計算効率が桁違いに高い。論文によれば、1Mトークン以上の規模では、最先端ES手法「EGGROLL」のTransformer実装と比較して10³〜10⁴倍効率的だという(外挿値)。
特筆すべき知見が2点ある。第一に、モデルが大きいほど集団効率が下がるとの通説に反し、243Mパラメータモデルは約120倍小さいモデルよりもほとんどの集団サイズで高性能を発揮した。大規模モデルほどゼロ次手法に向いているという逆説的な結果だ。
第二に、集団サイズを増やすとDustの勾配推定がバックプロパゲーションのそれと一致していくことが観察された。1Bトークンのスケールでもこの整合性が保たれており、スケーリングに対する楽観的な見通しを与える。場合によってはバックプロパゲーションを上回る精度も確認されたという。
著者らはRichard Sutton氏の「Bitter Lesson」を引用し、「低計算量の領域では微分可能性やバックプロパゲーションが効率的な帰納バイアスとなるが、計算資源が豊富になれば、より汎用的な探索アルゴリズムが優位に立つ可能性がある」と主張する。AlphaGoの人間データなしの自己対局版が最終的に人間データ活用版を超えた例を引きながら、同様の逆転が言語モデルの学習でも起きうると示唆する。
コードも公開されており、再現実験が可能だ。