Новый бенчмарк оценивает изображения с текстом, сгенерированные ИИ, в шести областях, включая коммерческие плакаты и чеки. Он показывает значительную зависимость от области и чувствительность к сжатию JPEG, что подчёркивает необходимость методов обнаружения, учитывающих текст и расположение.
Многодоменный бенчмарк для обнаружения текстовых изображений, сгенерированных ИИ
AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам
Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.
Экспертная повторная оценка показывает, что передовые модели достигли почти насыщения на физических бенчмарках
Исследование, проверяющее шесть широко используемых физических бенчмарков, выявило, что низкие результаты, сообщаемые для передовых языковых моделей, в значительной степени обусловлены ошибками бенчмаркинга, а не недостатками самих моделей. Эксперты проанализировали формулировки задач, эталонные решения и ответы моделей, отделив реальные ошибки от ошибок оценщиков, неверных ссылок и неоднозначных вопросов.
Оценка в режиме zero-shot показывает, что Gemini лидирует среди LLM по таксономии эмоций из 13 классов
Исследование оценило три коммерческие большие языковые модели — Claude (claude-sonnet-4-6), ChatGPT (GPT-5.4) и Gemini (gemini-2.5-flash) — на задаче тонкой классификации эмоций в режиме zero-shot с использованием стратифицированной выборки из 1 000 предложений из датасета boltuix/emotions.
Постер: Исследование пределов обнаружения турецких телефонных мошеннических звонков на основе аудио
Данное исследование изучает использование больших языковых моделей для обнаружения мошеннических телефонных звонков на турецком языке — языке с низким уровнем ресурсности, где аннотированные данные отсутствуют.
AI-созданная репутация бренда зависит от языка
Репутация бренда, созданная с помощью ИИ, значительно варьируется в зависимости от языка, при этом языки уральской и балтийской групп показывают более позитивные эмоции, в то время как германские языки, включая английский, более критичны. Язык запроса влияет на рекомендованные бренды, особенно для местных лидеров, где запросы на родном языке увеличивают видимость на 0,80 пунктов по сравнению с запросами на английском языке. Мониторинг только на английском языке не позволяет полностью охватить видимость ИИ для локально базирующихся брендов, создавая измеримую зону языковой нечувствительности.