Laboratoire · Cognition
lab Mistral AI News · il y a 10 j · 4 vues

Shieldstral présente un classificateur de sécurité multimodal 3B adaptatif aux politiques

Shieldstral est un classificateur de sécurité multimodal à poids ouverts de 3B paramètres qui formule la modération de contenu comme une tâche de réponse aux questions adaptative aux politiques, lui permettant d'accepter des politiques en langage naturel lors de l'inférence sans réentraînement. Il unifie l'évaluation de la sécurité du texte et de l'image et fournit des scores de sécurité calibrés sur divers benchmarks tout en s'exécutant efficacement sur une seule GPU NVIDIA 16 Go.

media r/LocalLLaMA · il y a 23 j

Cactus post-entraîne Gemma 4 E2B avec une sonde pour produire des scores de confiance

Cactus a post-entraîné le modèle Gemma 4 E2B afin de générer un score de confiance compris entre 0 et 1 pour chaque réponse, permettant aux développeurs d'acheminer les requêtes incertaines vers des modèles cloud plus grands. L'équipe y est parvenue en ajoutant une couche de sonde légère de 68k paramètres qui lit les états cachés intermédiaires pendant le décodage pour prédire la probabilité d'une erreur.