Mistral、3Bマルチモーダル安全分類モデル「Shieldstral」公開

원제: Mistral's Shieldstral: 3B open-weights model for multimodal moderation

왜 중요한가

再トレーニング不要のポリシー適応型設計により、多様な業界・用途のAIデプロイにおけるコンテンツ安全管理の民主化を促進する可能性がある。

Mistral AIは2026年8月4日、3Bパラメータのオープンウェイト多模態コンテンツ安全分類モデル「Shieldstral」を発表した。Apache 2.0ライセンスで公開され、最大7倍のサイズのモデルと同等以上の性能を達成。単一の16GB NVIDIA GPUで動作し、テキストと画像の安全評価を統合したポリシー適応型設計が特徴。

Mistral AIが公開した「Shieldstral」は、コンテンツモデレーションを政策適応型の質問応答タスクとして定式化した3Bパラメータのオープンウェイト多模態安全分類モデルだ。

従来のガードレールモデルはハームカテゴリの固定分類体系をウェイトに焼き込んでいるため、新しい展開コンテキストへの再適用には再トレーニングが必要だった。Shieldstralはこの問題を解決するため、ユーザーが推論時に平易な言語でポリシーを記述するだけで校正済み安全スコアを返す設計を採用。再トレーニングなし、単一インターフェースでテキストと画像の両方に対応し、単一トークンで判定を出力する。

性能面では、自身の最大7倍のサイズのモデルに匹敵するテキスト安全性能を発揮し、多模態モデレーション分野で新たな最先端を達成したとMistralは主張している。動作環境は16GB VRAMのNVIDIA GPU1枚で十分とされており、ローカル環境での運用も現実的だ。

同モデルはApache 2.0ライセンスのもとで公開されており、商用利用も含め自由に使用できる。また、NVIDIAなどとともに「Open Secure AI Alliance」の創設メンバーとしての参加も発表されており、オープンなAI安全技術の普及に向けた取り組みの一環として位置付けられている。詳細はMistralが公開したテクニカルレポートに記載されている。

출처

mistral.ai — 원문 읽기 →