Mistral、3BオープンWeightの多模態安全分類器Shieldstral発表

मूल शीर्षक: Mistral's Shieldstral: 3B open-weights model for multimodal moderation

यह क्यों महत्वपूर्ण है

再トレーニング不要のポリシー適応型安全分類器により、AI製品の安全対策コストと柔軟性が大幅に改善される可能性がある。

Mistral AIは2026年8月4日、3Bパラメータのオープンウェイト多模態安全分類器「Shieldstral」を発表した。Apache 2.0ライセンスで公開され、テキストと画像の安全評価を1つのインターフェースで処理し、自身の最大7倍のサイズのモデルと同等の性能を発揮する。

Mistral AIが発表した「Shieldstral」は、コンテンツモデレーションをポリシー適応型の質問応答タスクとして設計した3Bパラメータのオープンウェイト多模態安全分類器です。

従来のガードレールモデルは、害のカテゴリーを固定の重みとして組み込む方式を採用しており、新しい展開コンテキストに再適用するには再トレーニングが必要でした。一方、Shieldstralでは、推論時に自然言語でポリシーを記述するだけで、モデルが校正された安全スコアを返します。再トレーニングは不要で、テキストと画像の安全評価を単一のインターフェースで処理できます。

同モデルは、単一のNVIDIA 16GB GPUで効率的に動作し、多様なベンチマークで自身の最大7倍のサイズのモデルと同等のテキスト安全性能を示しました。また、多模態モデレーション分野で新たな最先端水準を達成したとされています。

ライセンスはApache 2.0で、商用・非商用を問わず自由に利用可能です。また、NVIDIAなどと共同で設立した「Open Secure AI Alliance」の一環としてリリースされています。

「サイバーセキュリティ研究ツールでは問題ないが、メンタルヘルスプラットフォームでは有害」といった、コンテキストによって異なる安全判断を、ポリシーの記述だけで柔軟に対応できる点が特徴です。

स्रोत

mistral.ai — मूल लेख पढ़ें →