Dust : entraîner des transformers sans rétropropagation
Original : Dust: Pretraining Transformers Without Backpropagation
Pourquoi c'est important
Remettre en cause la backprop pourrait libérer la conception d'architectures non différentiables.
Q Labs publie Dust, première méthode d'ordre zéro compétitive avec la backprop pour le préentraînement de transformers. Un modèle 243M paramètres surpasse un modèle 120× plus petit, testés jusqu'à 1 milliard de tokens.
La rétropropagation (backprop) est depuis des décennies l'unique algorithme capable d'entraîner les grands réseaux de neurones. Q Labs remet ce dogme en question avec Dust, une méthode dite « d'ordre zéro » — sans passe arrière — publiée en octobre 2026 par Samip Dahal, Bishwas Mandal, Serdar Gülbahar et Akshay Vegesna.
Le principe : perturber les activations (node perturbation) indépendamment à chaque token, si bien que chaque token agit comme un membre virtuel d'une population évaluée en un seul passage forward. L'efficacité gagnée est massive : à partir d'un million de tokens, Dust est 10³ à 10⁴ fois plus efficace que EGGROLL, méthode de référence en évolution stochastique (ES), selon les extrapolations des auteurs.
La surprise centrale du papier : contrairement à la croyance dominante, les grands modèles ne sont pas moins efficaces en population — ils sont plus efficaces. Un modèle de 243M paramètres surpasse un modèle 120 fois plus petit pour la plupart des tailles de population testées. Les estimations de gradient de Dust s'alignent de mieux en mieux sur celles de la backprop à mesure que la population augmente, et restent bien alignées jusqu'à 1 milliard de tokens.
Les auteurs s'appuient sur la « bitter lesson » de Sutton : les méthodes générales qui profitent du compute finissent par l'emporter. La backprop, bien que puissante en régime de faible calcul, contraint les architectures et exige la différentiabilité. Dans un régime riche en compute, Dust ouvre la voie à des architectures non différentiables.