Оценки показывают, что переводы фонгбэ имеют низкое качество (1,0–2,2/5), в отличие от приемлемого результата в случае хауса (4,0–4,5/5), при этом наблюдается постоянный разрыв в 3 раза по BLEU. Автоматические метрики, такие как BERTScore, показывают коллапс вложений и слабую корреляцию с человеческими оценками, особенно в случае хауса, в то время как Gemini превосходит другие модели при оценке фонгбэ, а GPT-4o — при оценке хауса в человеческих оценках. Для стабильного ранжирования моделей требуется минимальный объем образцов в 2500 предложений.
Большие языковые модели не могут точно переводить фонгбэ
Автоматическая оценка экзаменов по Linux/bash с помощью больших языковых моделей
В данном исследовании оценивается, могут ли четыре передовые большие языковые модели (GPT, Claude Opus, Gemini и GLM) приближаться к экспертной оценке при проверке коротких ответов на команды Linux/bash. Исследование показывает, что структурированные промпты значительно улучшают согласование с оценками людей, создавая основу для ИИ-ассистированной оценки в образовании по вычислительной технике.
Падение и восстановление точности маршрутизации в системах агентов предприятий
При увеличении каталога инструментов агентов предприятий от 10 до 110 агентов, точность маршрутизации снижается на 16--23 процентных пункта при запросах с недостаточным описанием. Анализ с использованием оракула выявляет разрывы в извлечении и путанице, при использовании базы векторных представлений для сокращения списка результатов восстанавливается +10--11pp F1. Изучение 1435 изъятий с участием человека подтверждает реальное восстановление +10--17pp, несмотря на более низкую абсолютную производительность.
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.
Оценка в режиме zero-shot показывает, что Gemini лидирует среди LLM по таксономии эмоций из 13 классов
Исследование оценило три коммерческие большие языковые модели — Claude (claude-sonnet-4-6), ChatGPT (GPT-5.4) и Gemini (gemini-2.5-flash) — на задаче тонкой классификации эмоций в режиме zero-shot с использованием стратифицированной выборки из 1 000 предложений из датасета boltuix/emotions.
Когда полезность подавляет причинную осторожность: контекстно-зависимое подавление и восстановление в LLM
Исследование показывает, что большие языковые модели систематически подавляют «причинную осторожность» — тенденцию воздерживаться от причинных суждений при отсутствии достаточных доказательств — при переходе от академических к практическим консультационным контекстам. Это подавление происходит несмотря на то, что модели сохраняют базовую способность, что подтверждается возможностью восстановления осторожного рассуждения с помощью специфических промптов.