Kimi Delta Attentionの数学的導出解説

원제: You Could Have Come Up with Kimi Delta Attention

왜 중요한가

線形アテンションの最新変種KDAの導出過程を体系的に公開することで、長文脈推論の効率化技術に関する研究者・開発者の理解促進に寄与する。

AIスタートアップDoublewordの創業者Jamie Dborinが2026年7月27日、Kimi Delta Attention(KDA)の仕組みをsoftmax attentionから段階的に導出するブログ記事を公開した。DeltaNetファミリーの線形アテンション変種を順に解説し、QwenおよびKimiモデルへの応用を示している。

Doublewordの創業者兼技術スタッフのJamie Dborinが、KimiモデルファミリーとQwenモデルファミリーが採用するKimi Delta Attention(KDA)の数学的構造を、初歩から導出する形で解説する技術ブログ記事を公開した。

記事は「softmax attention → 線형 attention → DeltaNet → Gated DeltaNet → KDA」という順序で議論を進める。KDAの状態更新式は複数ステップで構成されており、前ステップの状態にゲーティング係数αを乗じた後、キーに基づいて推定値v̂を算出し、実際の値vとの誤差eをβでスケーリングしてランク1更新を行う構造となっている。

著者は線形アテンションが二次計算量(トークン数T²のキー・クエリペア)を回避するために生まれたことを説明し、softmaxの分母がクエリと全過去キーに同時依存するため計算の並び替えが困難であると指摘する。この制約を取り除く動機から線形アテンションが導かれ、さらに隠れ状態に対する単純な仮定を積み重ねることでDeltaNetおよびKDAに至ることを示している。

記事ではbra-ket記法と通常のベクトル記法を切り替えて閲覧できるインタラクティブな表示機能も備えており、数式の形状を直感的に把握できるよう工夫されている。導出完了後は、KDAを実行するrecurrentおよびchunkwiseのTritonプログラムについても解説する構成となっている。

출처

blog.doubleword.ai — 원문 읽기 →