Mistral lance Shieldstral, modérateur multimodal 3B open-source

Original : Mistral's Shieldstral: 3B open-weights model for multimodal moderation

Pourquoi c'est important

La modération IA adaptative sans réentraînement simplifie le déploiement sécurisé des modèles en production.

Mistral AI a lancé Shieldstral, un modèle de classification de sécurité multimodal open-weights de 3 milliards de paramètres, sous licence Apache 2.0. Il égale des modèles jusqu'à 7 fois plus grands sur la modération de texte et établit un nouvel état de l'art pour la modération multimodale.

Mistral AI a publié Shieldstral, un classificateur de sécurité multimodal de 3 milliards de paramètres (3B), disponible en open-weights sous licence Apache 2.0. Contrairement aux modèles de garde-fous traditionnels qui intègrent une taxonomie fixe de catégories de nuisance dans leurs poids, Shieldstral adopte une approche novatrice : la politique de modération est fournie en langage naturel au moment de l'inférence, sous forme de question, et le modèle retourne un score de sécurité calibré en un seul token.

Cette architecture permet de cibler différents contextes de déploiement sans réentraînement — par exemple, un même contenu peut être acceptable pour un outil de recherche en cybersécurité mais inapproprié sur une plateforme de santé mentale. Shieldstral unifie l'évaluation de la sécurité pour le texte et les images au sein d'une interface unique, et fonctionne efficacement sur un seul GPU NVIDIA de 16 Go.

Selon Mistral, le modèle égale des modèles jusqu'à 7 fois plus grands sur les benchmarks de sécurité textuelle et établit un nouvel état de l'art sur la modération multimodale. Un rapport technique accompagne cette sortie. Shieldstral est également présenté dans le cadre de l'Open Secure AI Alliance, aux côtés de NVIDIA.

Source

mistral.ai — Lire l'original →