역전파 없이 Transformer 사전학습 성공

원제: Dust: Pretraining Transformers Without Backpropagation

왜 중요한가

역전파 의존성을 제거하면 비미분 아키텍처 학습이 가능해져 하드웨어·모델 설계의 제약이 근본적으로 달라질 수 있다.

Q Labs 연구팀은 2026년 10월, 역전파(backpropagation) 없이 Transformer 언어 모델을 사전학습하는 제로차수(zeroth-order) 방법 'Dust'를 공개했다. 활성화 공간 섭동(node perturbation)을 토큰별로 독립 적용해 단일 순전파로 병렬 평가를 수행하며, 243M 파라미터 모델에서 기존 역전파 방식과 경쟁력 있는 성능을 입증했다.

Q Labs의 Samip Dahal 등 4인 연구팀이 공개한 'Dust'는 역전파를 전혀 사용하지 않고 Transformer 언어 모델을 사전학습할 수 있는 첫 번째 제로차수 방법이다. 핵심 아이디어는 가중치가 아닌 활성화 공간에서 섭동을 가하는 것이다. 각 토큰을 가상 집단(population) 구성원으로 취급해 단일 순전파(forward pass) 안에서 모두 병렬 평가한다.

효율성 측면에서 Dust는 기존 진화 전략(ES) 방법 대비 압도적이다. 100만 토큰 이상 학습 시, 최신 ES 방법인 EGGROLL의 Transformer 구현체보다 10³~10⁴배 효율적이라고 연구팀은 외삽(extrapolation)을 통해 추정했다.

가장 주목할 결과는 스케일 역설이다. 제로차수 방법은 대형 네트워크에 확장되지 않는다는 통념과 달리, Dust에서는 모델이 클수록 집단 효율이 오히려 높아졌다. 243M 파라미터 모델이 120배 작은 모델보다 대부분의 집단 크기에서 우수한 성능을 보였다. 또한 집단 크기가 커질수록 Dust의 기울기 추정값이 역전파 기울기와 더 잘 정렬되었으며, 이 경향은 10억 토큰 규모까지 유지됐다. 컴퓨팅 자원이 풍부한 환경에서는 역전파를 능가할 수 있다는 가능성도 논문은 제시한다.

연구팀은 Richard Sutton의 'The Bitter Lesson'을 인용하며, 미분 가능성과 역전파는 저컴퓨팅 환경의 귀납적 편향일 뿐이며 고컴퓨팅 환경에서는 오히려 아키텍처 탐색 공간을 제한한다고 주장한다. 코드와 인용 정보는 qlabs.sh를 통해 공개됐다.

출처

qlabs.sh — 원문 읽기 →