小型Transformerが1.5時間の学習でLLMを超える

Original : I trained a small transformer in 1.5hrs and it beats many LLMs

Pourquoi c'est important

サンプル効率の限界を低コストで探求する実験的アプローチが注目を集める

Mithil Vakde氏(IIT Bombay卒)は、NVIDIA RTX 5090を使いわずか67セントのコストで1.5時間からゼロ訓練した小型Transformerを構築し、ARC-AGI-1ベンチマークで44%のスコアを達成した。多くのLLMを上回り、コードはオープンソースで公開されている。

インドのエンジニアMithil Vakde氏は、ARC-AGI-1ベンチマークで44%を達成する小型Transformerをわずか67セントのコストで訓練したと発表した。モデルはNVIDIA RTX 5090上で約1.5時間、テスト時に一からトレーニング(test-time training)される。前回モデル(40%)からの主な改善点は、SwiGLUやRMSNormなどの現代的アーキテクチャの採用、レイヤー数を4から8へのスケールアップ、Nornuonオプティマイザーへの切り替え、Flash AttentionとFlex Attentionカーネルの活用など。損失関数を出力トークンのみに限定したことで性能が向上した。また、ARC-2の非重複タスクを慎重にフィルタリングして追加訓練データとして使用。データリークを避けながらも汎化性能を高めている。コードはGitHubで公開されており、ARC-2では7%を記録。Lucas Beyer、Jeremy Howard、Rohan Anil ら著名研究者からも注目を集めた。

Source

mvakde.github.io — Lire l'original →