Новый бенчмарк оценивает изображения с текстом, сгенерированные ИИ, в шести областях, включая коммерческие плакаты и чеки. Он показывает значительную зависимость от области и чувствительность к сжатию JPEG, что подчёркивает необходимость методов обнаружения, учитывающих текст и расположение.
Многодоменный бенчмарк для обнаружения текстовых изображений, сгенерированных ИИ
Оценка в режиме zero-shot показывает, что Gemini лидирует среди LLM по таксономии эмоций из 13 классов
Исследование оценило три коммерческие большие языковые модели — Claude (claude-sonnet-4-6), ChatGPT (GPT-5.4) и Gemini (gemini-2.5-flash) — на задаче тонкой классификации эмоций в режиме zero-shot с использованием стратифицированной выборки из 1 000 предложений из датасета boltuix/emotions.
Постер: Исследование пределов обнаружения турецких телефонных мошеннических звонков на основе аудио
Данное исследование изучает использование больших языковых моделей для обнаружения мошеннических телефонных звонков на турецком языке — языке с низким уровнем ресурсности, где аннотированные данные отсутствуют.
AI-созданная репутация бренда зависит от языка
Репутация бренда, созданная с помощью ИИ, значительно варьируется в зависимости от языка, при этом языки уральской и балтийской групп показывают более позитивные эмоции, в то время как германские языки, включая английский, более критичны. Язык запроса влияет на рекомендованные бренды, особенно для местных лидеров, где запросы на родном языке увеличивают видимость на 0,80 пунктов по сравнению с запросами на английском языке. Мониторинг только на английском языке не позволяет полностью охватить видимость ИИ для локально базирующихся брендов, создавая измеримую зону языковой нечувствительности.
Оценка агентных систем анализа для исследований с участием ИИ
Исследование оценивает четыре системы анализа ИИ на шести моделях языков, в результате чего OpenAIReview с GPT-5.5 достигает точности 83,0% при сопоставлении качества научных статей с внешними сигналами и обнаруживает 71,6% введённых ошибок. Реальные отзывы пользователей показывают положительную оценку, с соотношением голосов 1,44 к 1, однако ошибочные положительные результаты и незначительные замечания остаются частыми.
REDACT: Мультималярный бенчмарк по обнаружению персональных данных с систематическим контролем
REDACT представляет систематически контролируемый мультималярный бенчмарк для обнаружения персональных данных, включающий 51 тип сущностей, 4127 паттернов поверхностных форм и 25 языков. Бенчмарк оценивает пять детекторов на 1000 записях, показывая, что модели на основе правил не справляются с высококритичными данными, в то время как модели на основе больших языковых моделей показывают лучшие результаты, особенно в высокочувствительных категориях. Оценка LLM без ссылки на эталон подтверждает, что назначение чувствительности по уровням является наиболее сложной осью оценки.