O Shieldstral é um classificador de segurança multimodal de pesos abertos com 3B parâmetros que enquadra a moderação de conteúdo como uma tarefa de resposta a perguntas adaptável a políticas, permitindo aceitar políticas em linguagem natural durante a inferência sem necessidade de retreinamento. Ele unifica a avaliação de segurança de texto e imagem e fornece pontuações de segurança calibradas em diversos benchmarks enquanto opera com eficiência em uma única GPU NVIDIA de 16GB.

  • Supera modelos de guard-rail até 7x seu tamanho na segurança de texto e estabelece um novo estado da arte na moderação multimodal.
  • Aceita políticas de linguagem natural livre durante a inferência, permitindo adaptação a contextos novos sem retreinamento.
  • Retorna uma pontuação contínua e calibrada de segurança por meio da normalização softmax dos logits sim/não de uma única passagem direta.
  • Treinado em fontes de dados heterogêneas consolidadas em um formato instrução-pergunta-documento com pares contrastivos deliberados para ensinar discriminação.

Essa abordagem permite que desenvolvedores adaptem dinamicamente as definições de segurança com base no contexto do produto e no público, evitando a necessidade de taxonomias de dano fixas embutidas nos pesos do modelo.