小型Transformerが67セントでARC-AGI-1を44%達成
Judul asli: I trained a small transformer in 1.5hrs and it beats many LLMs
Mengapa Ini Penting
極低コストでの高サンプル効率達成はAI研究の民主化に直結する重要事例
IIT Bombay出身のMithil Vakdeが、RTX 5090上で1.5時間・67セントのコストで訓練した小型Transformerを用い、ARC-AGI-1公開評価で44%を達成したと発表した。
インドのエンジニアリング物理学者Mithil Vakde(IIT Bombay '23)は、小型Transformerをゼロから約1.5時間・67セント(約100円)で訓練し、ARC-AGI-1公開評価で44%のスコアを記録したと自身のブログで報告した。これは多くの大規模言語モデル(LLM)を上回る成果であり、テスト時訓練(TTT)を行う同等手法と同水準のスコアに相当する。また、ARC-AGI-2でも7%を達成している。
アーキテクチャ面では、SwiGLU活性化関数・RMSNorm・3D RoPE埋め込み・flash attentionを採用。最適化にはAdamWからNormuonへ切り替え、レイヤー数を4から8に拡張した。損失関数を出力トークンのみに限定することで、スコアが40%から44%に向上した。コスト削減にはaugmentation回数の大幅削減も寄与している。コードはGitHubで公開されており、ARC-2の非重複タスクを慎重にフィルタリングしたうえで追加学習データとして活用している。前回の成果はLucas Beyer・Jeremy Howard・Rohan AnilらトップAI研究者の注目を集め、X上でも拡散された。