Kimi Delta Attentionの仕組みを解説
मूल शीर्षक: You Could Have Come Up with Kimi Delta Attention
यह क्यों महत्वपूर्ण है
QwenやKimiなど主要モデルファミリーが採用するlinear attentionの変種の数学的構造が体系的に解説され、研究者や開発者の理解促進に貢献する。
Doublewordの創設者Jamie Dborinが、Kimi Delta Attention(KDA)の数学的導出を解説するブログ記事を公開した。softmax attentionからlinear attention、DeltaNet、Gated DeltaNet、KDAへの段階的な導出過程を示している。
Doublewordの創設者兼技術スタッフのJamie Dborinは、最新のlinear attentionの変種であるKimi Delta Attention(KDA)の仕組みを、数学的な導出によって分かりやすく説明するブログ記事を公開した。
KDAはMoonshotAIのKimiモデルファミリーおよびQwenモデルファミリーで採用されており、DeltaNetファミリーの最新形である。記事では、hidden stateに関するシンプルな仮定から出発し、以下の順序でKDAを導出するアプローチを採用している:softmax attention → linear attention → DeltaNet → Gated DeltaNet → KDA。
KDAの状態更新式は、前の状態SにDiag(αt)を掛けたS̃tを計算し、現在のkeyに基づくvalue予測v̂tとの誤差etを求め、その誤差をS̃tに加算してStを得る構造になっている。
softmax attentionでは、系列長TのT²個のkey-queryペアを計算する必要があり、推論時にkeyとvalueをキャッシュしても、新しいクエリが全履歴を参照しなければならない問題がある。KDAはこの計算コストを削減するlinear attentionの発展形であり、記事ではsoftmaxを除去することから導出を始め、最終的にTritonプログラムによる実装まで解説している。
bra-ket記法と通常のベクトル記法を切り替えられるインタラクティブな数式表示機能も提供されている。