Kimi Linear: 풀 어텐션을 능가하는 하이브리드 선형 어텐션 아키텍처 공개
원제: Kimi Linear: An Expressive, Efficient Attention Architecture
왜 중요한가
선형 어텐션이 풀 어텐션 대비 성능·효율 모두에서 우위를 입증함으로써, 장문 컨텍스트 LLM 아키텍처의 설계 방향에 중요한 전환점이 될 수 있다。
중국 AI 기업 Moonshot AI의 Kimi 팀은 2025년 10월 30일, 하이브리드 선형 어텐션 아키텍처 'Kimi Linear'를 arxiv에 발표했다。동 모델은 단문·장문 컨텍스트 및 강화학습(RL) 스케일링 등 다양한 시나리오에서 처음으로 풀 어텐션을 공정 비교 기준으로 능가했다고 보고했다。
Kimi 팀은 핵심 모듈로 'Kimi Delta Attention(KDA)'을 제안했다. KDA는 기존 Gated DeltaNet을 확장해 세밀한 게이팅 메커니즘을 추가함으로써, 유한 상태 RNN 메모리를 보다 효과적으로 활용할 수 있도록 설계됐다. 또한 Diagonal-Plus-Low-Rank(DPLR) 전이 행렬의 특수 변형을 활용한 청크 단위 알고리즘을 통해 하드웨어 효율을 높였으며, 범용 DPLR 공식 대비 연산량을 대폭 줄였다.
사전 학습된 Kimi Linear 모델은 활성화 파라미터 30억 개, 총 파라미터 480억 개 규모로, KDA와 Multi-Head Latent Attention(MLA)을 레이어 단위로 혼합한 구조다. 동일한 학습 레시피로 비교 실험을 수행한 결과, Kimi Linear는 풀 MLA 대비 모든 평가 태스크에서 유의미한 성능 향상을 기록했다. KV 캐시 사용량은 최대 75% 절감되며, 100만 토큰 컨텍스트에서 디코딩 처리량은 최대 6배 향상됐다.
연구팀은 Kimi Linear가 입출력 길이가 긴 태스크를 포함해 기존 풀 어텐션 아키텍처의 드롭인 대체재가 될 수 있다고 밝혔다. KDA 커널 및 vLLM 구현 코드, 사전 학습 및 인스트럭션 튜닝 모델 체크포인트를 오픈소스로 공개했다.