ラボ · Cognition
lab Mistral AI News · 10日前 · 4 回表示

Shieldstralがポリシー適応型3Bマルチモーダル安全分類器を導入

Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして位置づける3Bのオープンウェイト・マルチモーダル安全分類器であり、再学習なしで推論時に自然言語によるポリシーを受け入れることができる。テキストと画像の安全評価を統一し、多様なベンチマークで補正された安全スコアを提供しながら、単一の16GB NVIDIA GPU上で効率的に動作する。

media r/LocalLLaMA · 23日前

CactusがGemma 4 E2Bをプローブ付きでポストトレーニングし、信頼度スコアを出力

CactusはGemma 4 E2Bモデルをポストトレーニングし、各応答に対して0から1の間の信頼度スコアを生成できるようにしました。これにより、開発者は不確実なクエリをより大きなクラウドモデルにルーティングできます。チームは、デコーディング中に中間の隠れ状態を読み取り、エラーの確率を予測する軽量な68kパラメータのプローブ層を追加することでこれを達成しました。