DeepSeek lance V4.1-Flash, modèle multimodal MoE 552B

Original : DeepSeek v4.1 Flash

Pourquoi c'est important

Un modèle MoE open source multimodal à faible coût d'inférence redéfinit les standards du secteur.

DeepSeek a annoncé le 10 septembre 2026 son nouveau modèle DeepSeek-V4.1-Flash, basé sur une architecture MoE de 552 milliards de paramètres avec seulement 8B paramètres actifs en entrée et 16B en sortie, intégrant nativement la compréhension visuelle.

DeepSeek a dévoilé DeepSeek-V4.1-Flash, le plus petit modèle de sa nouvelle famille d'architectures. Il repose sur une architecture MoE (Mixture of Experts) asymétrique de 552 milliards de paramètres, avec un Causal Encoder-Decoder inédit : 8B paramètres actifs pour le traitement en entrée et 16B pour la génération en sortie. Par rapport à la génération précédente, le cache KV nécessite seulement 1/4 de la mémoire HBM et 1/8 du stockage SSD, ce qui réduit significativement les coûts pour les applications de type agent IA. Le modèle est déjà disponible sur l'API DeepSeek via l'identifiant `deepseek-flash`, avec support multimodal natif. Les anciens modèles V4-Flash et V4-Flash-Vision-Exp sont retirés, mais leurs routes API redirigent temporairement vers V4.1-Flash pour assurer la compatibilité. DeepSeek indique répercuter les économies de coût sur les tarifs API, avec des prix hors-pic à 50 % des tarifs normaux. Le modèle est également publié en open source sur Hugging Face.

Source

x.com — Lire l'original →