Qwen3.8-2.4T : nouveau modèle MoE massif sur Hugging Face

Original : Qwen3.8-2.4T

Pourquoi c'est important

Un modèle MoE open-source de 2,4T paramètres renforce la compétition face aux grands modèles propriétaires.

Alibaba Cloud a publié Qwen3.8-2.4T-A95B sur Hugging Face, un modèle de langage de type Mixture-of-Experts (MoE) comptant 2,4 billions de paramètres au total, dont 95 milliards actifs, issu de la série Qwen3.

La page Hugging Face du modèle Qwen3.8-2.4T-A95B, développé par Alibaba Cloud via l'équipe Qwen, révèle qu'il s'agit d'un modèle MoE (Mixture-of-Experts) de très grande taille. Avec 2,4 trillions de paramètres au total et 95 milliards de paramètres actifs par inférence, ce modèle appartient à la génération Qwen3. La page présente un template de chat compatible avec les outils (function calling), incluant une gestion avancée du raisonnement via des blocs `<think>` et un paramètre `reasoning_instructions`. Ce design permet une utilisation en mode "thinking" (raisonnement étendu) ou en mode standard. Le modèle est disponible publiquement sur Hugging Face pour téléchargement et déploiement. Aucun chiffre de performance sur des benchmarks ni détail supplémentaire sur les données d'entraînement ne sont communiqués dans la page source analysée.

Source

huggingface.co — Lire l'original →