Kimi Linear: 効率的な線形Attentionアーキテクチャ

मूल शीर्षक: Kimi Linear: An Expressive, Efficient Attention Architecture

यह क्यों महत्वपूर्ण है

Full Attentionを超える線形Attentionの実証は、長文脈LLMの推論コスト削減において業界に大きな影響を与える可能性がある。

Moonshot AIのKimi Teamが2025年10月30日、新しいハイブリッド線形Attentionアーキテクチャ「Kimi Linear」を発表した。3B活性化パラメータ・総48Bパラメータのモデルで、KVキャッシュを最大75%削減し、1Mコンテキストでデコードスループットを最大6倍向上させる。

Kimi Teamは技術レポートにて、ハイブリッド線形Attentionアーキテクチャ「Kimi Linear」を公開した。このアーキテクチャは、短文脈・長文脈・強化学習(RL)スケーリングを含む様々なシナリオにおいて、公平な比較条件のもとで初めてFull Attentionを上回る性能を達成したと主張している。

中核技術は「Kimi Delta Attention(KDA)」と呼ばれる線形Attentionモジュールで、Gated DeltaNetをより細粒度のゲーティング機構で拡張し、有限状態RNNメモリの効率的な活用を実現している。また、対角プラス低ランク(DPLR)遷移行列の特殊化バリアントを用いた独自のチャンクワイズアルゴリズムにより、ハードウェア効率を高めつつ計算量を大幅に削減している。

モデルは活性化パラメータ3B・総パラメータ48Bで構成され、KDAとMulti-Head Latent Attention(MLA)をレイヤーごとにハイブリッドした設計となっている。同一の学習レシピで比較した場合、Full MLA対比で全評価タスクにおいて顕著な性能向上を示した。KVキャッシュ使用量を最大75%削減し、1Mコンテキスト時のデコードスループットを最大6倍向上させることも確認された。

KimiチームはKDAカーネルおよびvLLM実装をオープンソースで公開し、事前学習済みおよび指示調整済みモデルのチェックポイントもリリースしている。

स्रोत

arxiv.org — मूल लेख पढ़ें →