В данном исследовании оценивается, могут ли дообученные классификаторы ModernBERT в качестве энкодеров служить экономически эффективной альтернативой судьям на основе больших языковых моделей (LLM) для оценки безопасности. Исследователи провели бенчмаркинг ModernBERT и Ettin по сравнению с правиловым префиксным сопоставлением, дообученными классификаторами LLM и различными методологиями использования LLM в качестве судей. Эти LLM-судьи включали стратегии из StrongReject, ShieldGemma, JailbreakBench, AILuminate, SorryBench, Claude-as-a-judge, а также модели, такие как LlamaGuard 3 и 4. Классификаторы на основе энкодеров были обучены на данных с метками, полученными от судей, с использованием стратегии мажоритарного голосования для формирования меток, и протестированы на золотом стандарте (выделенной тестовой выборке). Производительность измерялась с помощью F1-меры, доли ложноотрицательных результатов и метрик точности и полноты по наборам данных adversarial-атак с открытым исходным кодом. Результаты дополнительно проанализированы по типу атаки, включая однократное формирование запроса (single-turn prompting), декомпозицию, эскалацию и манипуляцию контекстом. Полученные выводы дают рекомендации относительно того, когда классификаторы на основе энкодеров могут надежно заменять судей на основе LLM без существенной потери производительности.
Хватает ли только энкодеров? Систематическое сравнение судей безопасности на основе энкодеров и декодеров для adversarial-оценки больших языковых моделей
У ЛLM есть потенциал, но требуется улучшение для классификации антисемитских инцидентов
Это исследование оценивает способность больших языковых моделей обнаруживать и классифицировать сообщения об антисемитских событиях с использованием детализированных меток. Авторы протестировали GPT-4o от OpenAI и Llama-3.2-3B-Instruct от Meta на наборах данных, размеченных экспертами, полученных из новостных статей, отчетов гражданского общества и официальных записей.
Фреймворк PSALM оценивает стилистическое присвоение LLM в рамках законодательства ЕС об авторском праве
Авторы представляют PSALM, фреймворк типа "LLM-as-a-judge", предназначенный для практической реализации доктрины авторского права ЕС с целью оценки стилистического присвоения в больших языковых моделях. В отличие от существующих мер защиты, фокусирующихся на дословном запоминании, PSALM оценивает вычислительное перекрытие и стилистические измерения, такие как стиль письма и повествовательный голос.
Калибровка без понимания в обнаружении уязвимостей в LLM
CWE-Trace оценивает восемь прямых и 15 LoRA-настроенных LLM на обнаружении уязвимостей в ядре Linux. Результаты показывают, что заражение данными не дает преимущества, а настройка только сдвигает пороги вывода без изменения политики принятия решений. Несмотря на улучшение показателей обнаружения, LLM не обладают надежным безопасным мышлением, при этом точность по CWE на первом месте составляет менее 1,3%, а бинарная производительность обнаружения достигает 52,1%.
Совмещение LLM с использованием скрытой обратной связи пользователя
Новый набор данных IFLLM собирает данные о перемещении мыши и взгляде пользователя при взаимодействии с LLM. Он показывает, что скрытая обратная связь значительно улучшает выравнивание LLM, повышая точность текстовых моделей вознаграждения с 55% до 64% и почти втрое увеличивая качество ответов после обучения DPO на восьми LLM.
Совмещение LLM с использованием скрытой обратной связи пользователя
Новый набор данных IFLLM собирает данные о перемещении мыши и взгляде пользователя при взаимодействии с LLM. Он показывает, что скрытая обратная связь значительно улучшает выравнивание LLM, повышая точность текстовых моделей вознаграждения с 55% до 64% и почти утрачивая качество ответов после обучения DPO на восьми LLM.