Mistral、3B軽量マルチモーダル安全分類器Shieldstralを公開

Judul asli: Mistral's Shieldstral: 3B open-weights model for multimodal moderation

Mengapa Ini Penting

ポリシー適応型安全分類器の登場で、AI製品のガードレール構築コストが大幅に下がる可能性がある。

Mistral AIは2026年8月4日、3BパラメータのオープンウェイトマルチモーダルコンテンツモデレーターShieldstralをApache 2.0ライセンスで公開した。推論時にポリシーを自然言語で指定できる。

Mistral AIは、コンテンツモデレーション向けの安全分類モデル「Shieldstral」を発表した。パラメータ数は3Bで、Apache 2.0ライセンスのオープンウェイトモデルとして公開されている。

最大の特徴は、推論時に自然言語でポリシーを指定できる設計にある。従来のガードレールモデルは固定されたハームカテゴリをウェイトに組み込むため、新しいデプロイ環境に対応するには再学習が必要だった。Shieldstralは「このコンテンツは特定グループへの暴力を促進しているか?」「この画像は未成年に見せて安全か?」といった自然言語の質問を受け取り、キャリブレーションされた安全スコアを単一トークンで返す。

テキスト安全性の評価では最大7倍のサイズのモデルに匹敵し、マルチモーダルモデレーションでは新たな最高水準を達成したと同社は説明する。テキストと画像の安全評価を単一インターフェースで処理でき、16GBのNVIDIA GPU一台で動作する。Mistral AIはNVIDIAとともに「Open Secure AI Alliance」の創設メンバーにも名を連ねている。

Sumber

mistral.ai — Baca artikel asli →