Laboratório · Cognition
lab Mistral AI News · há 11 d · 4 visualizações

Shieldstral apresenta classificador de segurança multimodal de 3B adaptável a políticas

O Shieldstral é um classificador de segurança multimodal de pesos abertos com 3B parâmetros que enquadra a moderação de conteúdo como uma tarefa de resposta a perguntas adaptável a políticas, permitindo aceitar políticas em linguagem natural durante a inferência sem necessidade de retreinamento. Ele unifica a avaliação de segurança de texto e imagem e fornece pontuações de segurança calibradas em diversos benchmarks enquanto opera com eficiência em uma única GPU NVIDIA de 16GB.

media r/LocalLLaMA · há 23 d

Cactus pós-treina o Gemma 4 E2B com um probe para gerar escores de confiança

A Cactus realizou o pós-treinamento do modelo Gemma 4 E2B para gerar um escore de confiança entre 0 e 1 para cada resposta, permitindo que desenvolvedores direcionem consultas incertas para modelos maiores na nuvem. A equipe conseguiu isso adicionando uma camada de probe leve com 68k parâmetros que lê os estados ocultos intermediários durante a decodificação para prever a probabilidade de um erro.