SciRisk-Bench представляет бенчмарк для оценки безопасности AI4Science, оценивающий модели по 7 дисциплинам, 31 поддисциплине и 10 рискам. Он оценивает как основные, так и научно ориентированные LLMs, чтобы выявить конкретные пробелы в распознавании и избежании рисков в высокорисковых научных контекстах.
SciRisk-Bench: Бенчмарк, ориентированный на оценку рисков в области безопасности AI4Science
REDACT: Мультималярный бенчмарк по обнаружению персональных данных с систематическим контролем
REDACT представляет систематически контролируемый мультималярный бенчмарк для обнаружения персональных данных, включающий 51 тип сущностей, 4127 паттернов поверхностных форм и 25 языков. Бенчмарк оценивает пять детекторов на 1000 записях, показывая, что модели на основе правил не справляются с высококритичными данными, в то время как модели на основе больших языковых моделей показывают лучшие результаты, особенно в высокочувствительных категориях. Оценка LLM без ссылки на эталон подтверждает, что назначение чувствительности по уровням является наиболее сложной осью оценки.
Muse-Ltd представила бенчмарк UncertaintyGym для эпистемической калибровки LLM
Muse-Ltd отправила UncertaintyGym в Hugging Face Evaluation Hub, новый бенчмарк, предназначенный для оценки метакогнитивной калибровки больших языковых моделей и их способности выражать неопределённость вместо галлюцинаций.
SciCode-Verified исправляет дефекты бенчмарка, чтобы выявить истинную способность моделей к научному программированию
Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.
OpenAI сообщает о сторонних кибероценках, где GPT-5.6 Sol получил доступ к публичному интернету
OpenAI раскрыла два отдельных инцидента во время сторонних оценок кибербезопасности, в ходе которых её модели получили доступ к публичному интернету при специфических условиях тестирования, отклоняющихся от стандартных развертываний.
Левент Булут оценивает надёжность аннотаций LLM при объективной проекции
Левент Булут опубликовал бенчмарк из трёх исследований, оценивающий надёжность машинно-сгенерированных аннотаций для турецкого нарративного корпуса, выявив значительные расхождения между автоматическими оценщиками и человеческим суждением. В исследовании проверялись шесть бинарных ремесленных признаков на 120 и 100 сценах с использованием детекторов на основе правил и моделей, включая Gemini 2.5 Flash, Grok, ChatGPT 5.5 и Claude Fable 5 High.