Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.

  • Превосходит модели-охранники размером до 7 раз больше в оценке безопасности текста и устанавливает новый state of the art в мультимодальной модерации.
  • Принимает политики в свободной форме на естественном языке во время вывода, что позволяет адаптироваться к новым контекстам без переобучения.
  • Возвращает непрерывную калиброванную оценку безопасности путем нормализации softmax логитов «да/нет» из одного прямого прохода.
  • Обучена на гетерогенных источниках данных, консолидированных в формат инструкции-запроса-документа с преднамеренными контрастными парами для обучения дискриминации.

Этот подход позволяет разработчикам динамически адаптировать определения безопасности в зависимости от контекста продукта и аудитории, избегая необходимости использовать фиксированные таксономии вреда, зашитые в веса модели.