Shieldstral es un clasificador de seguridad multimodal de pesos abiertos de 3B que enmarca la moderación de contenido como una tarea de respuesta a preguntas adaptable a políticas, lo que le permite aceptar políticas en lenguaje natural durante la inferencia sin necesidad de reentrenamiento. Unifica la evaluación de seguridad de texto e imágenes y proporciona puntuaciones de seguridad calibradas en diversos benchmarks mientras se ejecuta de manera eficiente en una única GPU NVIDIA de 16GB.

  • Supera a los modelos de guardarraíl hasta 7 veces su tamaño en seguridad de texto y establece un nuevo estado del arte en moderación multimodal.
  • Acepta políticas de lenguaje natural de forma libre durante la inferencia, permitiendo la adaptación a contextos nuevos sin reentrenamiento.
  • Devuelve una puntuación de seguridad continua y calibrada mediante la normalización softmax de los logits sí/no de un único paso hacia adelante.
  • Entrenado con fuentes de datos heterogéneas consolidadas en un formato de instrucción-pregunta-documento con pares contrastivos deliberados para enseñar discriminación.

Este enfoque permite a los desarrolladores adaptar dinámicamente las definiciones de seguridad según el contexto del producto y la audiencia, evitando la necesidad de taxonomías de daño fijas incrustadas en los pesos del modelo.