Qwen3 최대 규모 MoE 모델 공개

원제: Qwen3.8-2.4T

왜 중요한가

총 2.4조 파라미터의 오픈 MoE 모델 공개는 오픈소스 대형 언어 모델 생태계의 규모 한계를 새롭게 갱신하는 사건이다。

Alibaba의 Qwen 팀은 Hugging Face에 총 파라미터 수 2.4조(2.4T), 활성 파라미터 950억(95B)의 대규모 Mixture-of-Experts(MoE) 언어 모델 「Qwen3.8-2.4T-A95B」를 공개했다。Qwen3 시리즈 최상위 모델로, 추론·도구 사용·다국어 등 광범위한 기능을 지원한다。

Alibaba Cloudが開発するQwen 팀은 Hugging Face 모델 허브에 「Qwen3.8-2.4T-A95B」를 공개했다。모델명에서 알 수 있듯이 총 파라미터 수는 약 2.4조(Trillion)이며, 추론 시 실제로 활성화되는 파라미터는 950억(95B)이다。MoE(Mixture-of-Experts) 아키텍처를 채택해 대규모 용량과 효율적인 추론을 양립시킨다。

공개된 모델 카드에 따르면, 해당 모델은 사고(Thinking) 모드와 비사고(Non-Thinking) 모드 전환을 지원하며, 도구 호출(Tool Calling) 기능을 위한 전용 채팅 템플릿도 내장하고 있다。내부 템플릿은 `reasoning_instructions` 필드를 통해 추론 지침을 시스템 프롬프트에 동적으로 삽입하는 구조를 가진다。또한 다단계 도구 호출(Multi-step Tool Call) 흐름을 공식으로 지원하며, `tool_response` 태그를 통해 도구 결과를 모델에 반환할 수 있다。

Qwen3 시리즈는 이전 Qwen2.5 대비 추론 능력과 지시 따르기(instruction following) 성능을 크게 향상시킨 것으로 알려져 있다。「Qwen3.8-2.4T-A95B」는 시리즈 내 최대 규모 모델로 위치하며, 기업 및 연구 용도의 고성능 추론 파이프라인 구축에 활용될 것으로 기대된다。라이선스 및 세부 벤치마크 수치는 Hugging Face 모델 페이지에서 확인할 수 있다。

출처

huggingface.co — 원문 읽기 →