Исследование 3750 запросов в пяти отраслях показало умеренную концентрацию рекомендаций, с средним коэффициентом Гини в 0,28. Согласие между моделями по рекомендованным брендам составило только 41,6%, а показатели смещения варьировались в зависимости от отрасли, от 0,4:1 до 4,3:1. Результаты противоречат концепции «победитель получает всё» и вводят три воспроизводимых метрики для анализа конкуренции.
Владение рекомендациями ИИ: эмпирическая карта владения брендами в категории
AI-созданная репутация бренда зависит от языка
Репутация бренда, созданная с помощью ИИ, значительно варьируется в зависимости от языка, при этом языки уральской и балтийской групп показывают более позитивные эмоции, в то время как германские языки, включая английский, более критичны. Язык запроса влияет на рекомендованные бренды, особенно для местных лидеров, где запросы на родном языке увеличивают видимость на 0,80 пунктов по сравнению с запросами на английском языке. Мониторинг только на английском языке не позволяет полностью охватить видимость ИИ для локально базирующихся брендов, создавая измеримую зону языковой нечувствительности.
Автоматическая оценка экзаменов по Linux/bash с помощью больших языковых моделей
В данном исследовании оценивается, могут ли четыре передовые большие языковые модели (GPT, Claude Opus, Gemini и GLM) приближаться к экспертной оценке при проверке коротких ответов на команды Linux/bash. Исследование показывает, что структурированные промпты значительно улучшают согласование с оценками людей, создавая основу для ИИ-ассистированной оценки в образовании по вычислительной технике.
OpenBioRQ: Бенчмарк для верности агентных исследований в биомедицине
OpenBioRQ вводит бенчмарк из 12 553 нерешённых вопросов в области биомедицинских исследований в 12 областях, разработанный для проверки верности и отказа агентных моделей. Он оценивает модели в условиях использования инструментов без ключей ответов, используя реальные доказательства последующих шагов, а не параметрические знания, и показывает значительное падение агентной способности на самые сложные вопросы, где инструменты больше не используются, несмотря на их критическую важность.
Большие языковые модели не могут точно переводить фонгбэ
Оценки показывают, что переводы фонгбэ имеют низкое качество (1,0–2,2/5), в отличие от приемлемого результата в случае хауса (4,0–4,5/5), при этом наблюдается постоянный разрыв в 3 раза по BLEU. Автоматические метрики, такие как BERTScore, показывают коллапс вложений и слабую корреляцию с человеческими оценками, особенно в случае хауса, в то время как Gemini превосходит другие модели при оценке фонгбэ, а GPT-4o — при оценке хауса в человеческих оценках. Для стабильного ранжирования моделей требуется минимальный объем образцов в 2500 предложений.
Совмещение LLM с использованием скрытой обратной связи пользователя
Новый набор данных IFLLM собирает данные о перемещении мыши и взгляде пользователя при взаимодействии с LLM. Он показывает, что скрытая обратная связь значительно улучшает выравнивание LLM, повышая точность текстовых моделей вознаграждения с 55% до 64% и почти втрое увеличивая качество ответов после обучения DPO на восьми LLM.