Qwen3.8-2.4T-A95B、Hugging Faceで公開
Judul asli: Qwen3.8-2.4T
Mengapa Ini Penting
2.4兆パラメータのMoEモデル公開はオープンソースLLM分野で業界最大級規模のリリースの一つ。
AlibabaのQwenチームがMoEアーキテクチャを採用した大規模言語モデル「Qwen3.8-2.4T-A95B」をHugging Face上で公開した。
AlibabaのQwenチームは、Mixture-of-Experts(MoE)アーキテクチャを採用した大規模言語モデル「Qwen3.8-2.4T-A95B」をHugging Faceで公開した。モデル名が示す通り、総パラメータ数は2.4兆(2.4T)規模で、そのうち推論時にアクティブとなるパラメータは950億(95B)である。このモデルはQwen3シリーズの最新フラッグシップに位置付けられ、チャット・推論・ツール呼び出しなど多様なタスクに対応する。公開されたモデルカードには、思考(thinking)モードと非思考モードの切り替え機能、ツール呼び出し用のフォーマット仕様、およびシステムプロンプトの処理ロジックを含む詳細なチャットテンプレートが示されている。モデルはHugging FaceのTransformersおよびvLLMなどの推論フレームワークに対応しており、商用・研究用途向けに利用可能である。