Mistral、AIの安全判定モデルShieldstralを公開
この記事の要点
Mistralが8月4日、文章と画像を審査する30億パラメータの公開モデルShieldstralを出した。方針を平易な言葉で指定でき、16GBのGPU1枚で動く。AIを顧客に使わせる企業が、入力と出力の安全確認を自社で持てるようになる。
結論
Mistralが8月4日、文章と画像の安全性を判定する30億パラメータの公開モデルShieldstralを出した。特徴は、審査の方針を平易な言葉で指定できる点だ。訓練の時点で有害の種類を固定せず、使うときに「この内容はこの方針に反するか」という形で方針を渡す。Apache 2.0のもとHugging Faceで公開され、16GBのGPU1枚で動くとされる。AIを顧客や社外に使わせる企業が、入力と出力の安全確認を自社の手元に持てるようになる。
何が公開されたか
Shieldstralは12言語に対応し、テキストの安全判定では自身の7倍規模の既存モデルに匹敵し、画像を含む審査では最高水準に達したとMistralは説明する。従来の防御モデルは、有害の分類を重みの中に固定していた。Shieldstralは、使う場面ごとに方針を平易な言葉の質問として与えられるため、対象の利用者や用途に合わせて基準を調整しやすい。技術報告はarXivに、重みと説明はMistralの公開先に置かれた。詳細はMistralの発表にある。性能や仕様は今後更新されうるため、最新は公式で確認してほしい。
AIの安全確認を外部サービスに任せず、自社の環境で持てることには実務上の意味がある。社内データや利用者の入力を外に出さずに審査できるからだ。加えて、どの判定を通し、どれを止めたかを記録に残せば、後から運用を検証しやすくなる。記録の考え方は生成AIのログ・監査の考え方 企業が記録すべき情報と運用方法にまとめている。
現場の実務にどう効くか
AIを社内の問い合わせ対応や顧客向けの機能に組み込む企業にとって、入力と出力の確認は避けて通れない。利用者が不適切な指示を入れる、AIが公開すべきでない内容を返す、といった事故を止める仕組みが要る。Shieldstralのような判定モデルは、その確認をアプリの手前と出口に挟む部品として使える。
推進担当や情シスが押さえるべきは、道具を入れる前に方針を言葉にしておくことだ。何を止め、何を通すのかが曖昧なままでは、判定モデルを入れても基準がぶれる。社外に出す前の確認観点はAI出力を社外公開する前のチェックリスト 法的・品質・情報の3観点、悪意ある入力への備えはプロンプトインジェクションとは?仕組みと企業の対策にまとめている。基本の考え方と社内ルールの整え方は生成AIとセキュリティ 情報漏洩を防ぐ基本と社内ルール策定が使える。判定モデルは万能ではない。方針を明文化し、自社の基準で試験してから本番に載せる順番を守ることが、事故を防ぐ近道だ。
出典
よくある質問
Shieldstralは何をするモデルですか
文章や画像が、指定した安全方針に反していないかを判定する専用モデルです。方針を平易な言葉の質問として与えると、それに沿って可否を返します。AIを使うアプリの入力と出力を確認し、不適切な内容を止める用途に向きます。
自社でも使えますか
重みが公開され、16GBのGPU1枚で動くとされるため、自社環境に置いて使う選択肢があります。ただし判定は完全ではなく、方針の書き方や運用の設計で精度が変わります。導入する場合は、自社の基準で試験してから本番に載せてください。