Kimi Delta Attention : dérivation pas à pas

Original : You Could Have Come Up with Kimi Delta Attention

Pourquoi c'est important

KDA illustre l'adoption industrielle de l'attention linéaire dans les grands modèles de langage.

Le blog Doubleword publie le 27 juillet 2026 une explication pédagogique de Kimi Delta Attention (KDA), mécanisme d'attention linéaire utilisé dans les modèles Qwen et Kimi, en retraçant l'évolution depuis softmax attention jusqu'à KDA via DeltaNet et Gated DeltaNet.

L'article de Jamie Dborin, fondateur de Doubleword, propose une dérivation mathématique complète de Kimi Delta Attention (KDA), le mécanisme d'attention linéaire adopté par les familles de modèles Kimi et Qwen. L'auteur part du constat que les variantes modernes d'attention linéaire semblent inaccessibles de l'extérieur, leur complexité ayant progressivement augmenté au fil des années. La dérivation suit la chaîne : softmax attention → attention linéaire → DeltaNet → Gated DeltaNet → KDA. L'article commence par l'attention causale quadratique classique, dont le coût est O(T²) en raison des T² paires clé-requête, puis montre comment supprimer le softmax permet de reformuler le calcul sous forme d'un état caché matriciel S_t mis à jour de façon récurrente. L'équation centrale de KDA introduit un terme d'erreur |e_t⟩ = β_t(|v_t⟩ − |v̂_t⟩) corrigeant la prédiction courante de la valeur, combiné à un facteur de gating diagonal Diag(α_t). L'article promet d'aborder ensuite les implémentations recurrentes et chunkwise en Triton.

Source

blog.doubleword.ai — Lire l'original →