Kimi Delta Attentionの仕組みを数学で解説
Judul asli: You Could Have Come Up with Kimi Delta Attention
Mengapa Ini Penting
QwenやKimiなど主要LLMが採用するlinear attentionの設計思想が公開され、研究者や開発者の理解促進に寄与する。
Doublewordの創業者Jamie Dborinが、KimiとQwenが採用するKimi Delta Attention(KDA)の数学的導出過程をブログで公開。softmax attentionからKDAまでの発展を解説。
DoublewordのFounder兼Technical StaffであるJamie Dborinは、Kimi Delta Attention(KDA)の仕組みを一般向けに解説するブログ記事を公開した。KDAは最新のQwenおよびKimiモデルファミリーで採用されているlinear attentionの一変種である。
記事ではbra-ket記法を用い、通常のcausal softmax attentionから出発し、linear attention、DeltaNet、Gated DeltaNetを経てKDAに至る導出過程を順を追って説明している。KDAの状態更新式には対角行列Diag(αt)による重み付けや、予測誤差etを用いた状態の補正が含まれ、その複雑さの背景にある設計意図を明確にしている。
softmax attentionはシーケンス長Tに対してT²のkey-queryペアを必要とし、自己回帰推論時にはキャッシュがシーケンスとともに増大するという課題がある。KDAはこの問題に対処するlinear attentionの系譜に位置づけられ、記事後半ではrecurrentおよびchunkwiseのTritonプログラムによる実装についても解説している。