Kimi K3 : architecture du plus grand modèle open-weight
Original : Kimi K3 Architecture Overview and Notes
Pourquoi c'est important
Kimi K3 établit un nouveau seuil en open-weight et valide des choix architecturaux inédits à cette échelle.
Le 28 juillet 2026, Sebastian Raschka publie une analyse de l'architecture de Kimi K3, modèle open-weight de 2,8 billions de paramètres — le plus grand jamais publié en open-weight — issu d'une mise à l'échelle de Kimi Linear (48B).
Kimi K3 est présenté comme une version de production à grande échelle du modèle Kimi Linear, dont la taille passe de 48B à 2,8T de paramètres, ce qui en fait le plus grand modèle open-weight disponible à ce jour. L'architecture intègre plusieurs composants orientés efficacité à l'inférence : remplacement du MoE classique par un LatentMoE (déjà présent dans Nemotron 3 Ultra), utilisation du multi-head latent attention et du Kimi Delta Attention. Le LatentMoE compresse les grandes couches linéaires via une projection descendante, à l'image du multi-head latent attention. Concernant la résiduelle, Kimi K3 adopte les « attention residuals » hérités de Kimi Linear : des connexions inter-couches pondérées par un score d'attention, qui améliorent la validation loss au prix de +4 % en coût d'entraînement et +2 % en inférence. Fait notable : Kimi K3 abandonne totalement RoPE au profit de NoPE (No Positional Embeddings) sur l'ensemble des couches, une première pour un modèle de niveau frontier selon l'auteur. Le modèle intègre également un support multimodal natif.