Kimi K3のアーキテクチャ詳細:2.8T最大オープンモデル

Judul asli: Kimi K3 Architecture Overview and Notes

Mengapa Ini Penting

2.8兆パラメータの最大オープンウェイトモデル登場で、推論効率化技術の競争が加速。

Moonshot AIが公開したKimi K3は2.8兆パラメータのオープンウェイトモデルで、LatentMoE・マルチヘッドLatent Attention・NoPEを採用し推論効率を大幅改善した。

AI研究者Sebastian Raschka博士が、Moonshot AIの新作オープンウェイトモデル「Kimi K3」のアーキテクチャを詳細に解説した。Kimi K3は昨年リリースされた「Kimi Linear」(48Bパラメータ)を大幅にスケールアップした2.8兆パラメータのモデルであり、現時点で最大のオープンウェイトモデルとされる。

主な新コンポーネントは「LatentMoE」で、Nemotron 3 Ultraと同様の仕組みを採用。大規模な線形レイヤーを圧縮(ダウンプロジェクト)することで推論効率を向上させる。また、通常のAttentionをMulti-Head Latent AttentionおよびKimi Delta Attentionに置き換えることで、さらなる効率化を図っている。

効率化以外の構造的改善として「Attention Residuals」を採用。これはレイヤー間でResidualsを接続し、AttentionスコアをWeightとして利用する手法で、技術レポートによると検証ロスと下流タスクの性能を一貫して改善し、学習コストは約4%、推論コストは約2%増加するとされている。

位置埋め込みについては、RoPEを完全に廃止してNoPE(No Positional Embeddings)のみを全レイヤーで採用した。これはKimi Linearから引き継いだ設計であり、フロンティアレベルのモデルで全面的にNoPEを採用した初の事例とみられる。さらにネイティブなマルチモーダルサポートも追加されている。

Sumber

sebastianraschka.com — Baca artikel asli →