Kimi Linear: 全注意機構を超える効率的アーキテクチャ

Judul asli: Kimi Linear: An Expressive, Efficient Attention Architecture

Mengapa Ini Penting

線形アテンションが初めて全注意機構を全面的に上回り、大規模LLMの推論効率化に新たな選択肢を示した。

Moonshot AIのKimi Teamが2025年10月30日、線形アテンション構造「Kimi Linear」を発表。3Bの活性化パラメータと48B合計パラメータを持ち、KVキャッシュを最大75%削減しながら全注意機構を性能で上回る。

Kimi Teamは論文「Kimi Linear: An Expressive, Efficient Attention Architecture」を arXiv に公開した。中核技術はKimi Delta Attention(KDA)と呼ばれる線形アテンションモジュールで、Gated DeltaNetをより細粒度なゲーティング機構で拡張し、有限状態RNNメモリをより効率的に活用する。独自のチャンク単位アルゴリズムはDiagonal-Plus-Low-Rank(DPLR)遷移行列の特化型バリアントを採用し、汎用DPLR比で計算量を大幅に削減する。KDAとMulti-Head Latent Attention(MLA)を層ごとにハイブリッドした3B活性化・48B総パラメータモデルを事前学習。同一トレーニング設定での比較において、短文・長文コンテキストおよび強化学習スケーリングのすべてのシナリオで、完全MLA(全注意機構)を有意な差で上回った。KVキャッシュ使用量は最大75%削減、1Mコンテキストでのデコードスループットは最大6倍を達成。KDAカーネル・vLLM実装はオープンソースとして公開され、事前学習済みおよび指示調整済みモデルのチェックポイントもリリースされる。

Sumber

arxiv.org — Baca artikel asli →