Shieldstral — это 3B модель с открытыми весами, являющаяся мультимодальным классификатором безопасности, которая рассматривает модерацию контента как задачу ответа на вопросы, адаптируемую к политике, что позволяет ей принимать политики на естественном языке во время вывода без переобучения. Она объединяет оценку безопасности текста и изображений и предоставляет калиброванные оценки безопасности по различным бенчмаркам, эффективно работая на одном GPU NVIDIA с 16 ГБ памяти.
- Превосходит модели-охранники размером до 7 раз больше в оценке безопасности текста и устанавливает новый state of the art в мультимодальной модерации.
- Принимает политики в свободной форме на естественном языке во время вывода, что позволяет адаптироваться к новым контекстам без переобучения.
- Возвращает непрерывную калиброванную оценку безопасности путем нормализации softmax логитов «да/нет» из одного прямого прохода.
- Обучена на гетерогенных источниках данных, консолидированных в формат инструкции-запроса-документа с преднамеренными контрастными парами для обучения дискриминации.
Этот подход позволяет разработчикам динамически адаптировать определения безопасности в зависимости от контекста продукта и аудитории, избегая необходимости использовать фиксированные таксономии вреда, зашитые в веса модели.