小型Transformerが1.5時間でARC-AGI-1に44%達成
मूल शीर्षक: I trained a small transformer in 1.5hrs and it beats many LLMs
यह क्यों महत्वपूर्ण है
低コスト・短時間でのTest Time Trainingがサンプル効率の新たな限界を示し、AIの民主化に貢献する事例として注目される。
IIT Bombayの研究者Mithil Vakdeが、RTX 5090上でわずか67セント(約100円)のコストで1.5時間かけてゼロからTransformerを訓練し、ARC-AGI-1公開評価で44%を達成した。多くのLLMを上回る性能を示し、コードはオープンソースとして公開されている。
IIT Bombay(2023年卒)のMithil Vakdeは、ARC-AGIベンチマークに取り組む一連の研究の第3弾として、小型Transformerをゼロから訓練し、ARC-AGI-1公開評価で44%のスコアを達成したと発表した。訓練コストはわずか67セント、所要時間は約1.5時間(NVIDIA RTX 5090使用)。
技術的なアプローチとして、各入力・出力ペアをトークン列に変換し、小型Transformerでテスト時に自己回帰的に訓練する「Test Time Training(TTT)」手法を採用。クロスタスク学習を可能にするため各パズルに個別の加算埋め込みを使用し、3D RoPE埋め込みで位置情報を表現している。
前バージョン(40%)からの主な改善点は、SwiGLUやRMSNormなど現代的なアーキテクチャの採用、8層への拡張(従来は4層)、Normuonオプティマイザー(AdamWから変更)、Flash AttentionやFlex Attentionカーネルの導入など。また、入力トークンに対する損失を除外し出力トークンのみを対象とする教師あり学習方式に変更したことで、40%から44%に向上した。
ARC-2の非重複タスクを追加訓練データとして慎重に使用(データ漏洩を防ぐためARC-1と重複する773タスクを除外)。追加データなしでも約40%のスコアが得られるが、約2倍の計算コストが必要とされる。ARC-2では7%を記録。本研究はLucas Beyer、Jeremy Howard、Rohan Anilなど著名研究者の注目を集めた。