Kimi Linear : architecture d'attention linéaire haute performance

Original : Kimi Linear: An Expressive, Efficient Attention Architecture

Pourquoi c'est important

Une alternative open source à l'attention classique, plus rapide et moins coûteuse en mémoire.

Moonshot AI publie Kimi Linear, une architecture hybride d'attention linéaire surpassant pour la première fois l'attention classique (full attention) dans les contextes courts, longs et en apprentissage par renforcement, avec 3B paramètres actifs et 48B paramètres totaux.

La Kimi Team (Moonshot AI) a publié le 30 octobre 2025 un rapport technique présentant Kimi Linear, une architecture hybride d'attention linéaire conçue pour surpasser les modèles full attention dans des conditions de comparaison équitables. Au cœur du système se trouve Kimi Delta Attention (KDA), un module d'attention linéaire expressif qui étend Gated DeltaNet via un mécanisme de gating plus fin, permettant une utilisation plus efficace de la mémoire finie des RNN. Un algorithme « chunkwise » sur mesure exploite des matrices de transition Diagonal-Plus-Low-Rank (DPLR) spécialisées, réduisant significativement les calculs. Le modèle pré-entraîné combine KDA et Multi-Head Latent Attention (MLA) couche par couche, avec 3B paramètres activés et 48B au total. Les expériences montrent que Kimi Linear surpasse MLA complet sur toutes les tâches évaluées, tout en réduisant l'utilisation du KV cache jusqu'à 75 % et en multipliant par 6 le débit de décodage pour un contexte de 1 million de tokens. Le noyau KDA, l'intégration vLLM ainsi que les checkpoints pré-entraînés et fine-tunés sont publiés en open source.

Source

arxiv.org — Lire l'original →