Исследование 3750 запросов в пяти отраслях показало умеренную концентрацию рекомендаций, с средним коэффициентом Гини в 0,28. Согласие между моделями по рекомендованным брендам составило только 41,6%, а показатели смещения варьировались в зависимости от отрасли, от 0,4:1 до 4,3:1. Результаты противоречат концепции «победитель получает всё» и вводят три воспроизводимых метрики для анализа конкуренции.
Владение рекомендациями ИИ: эмпирическая карта владения брендами в категории
AI-созданная репутация бренда зависит от языка
Репутация бренда, созданная с помощью ИИ, значительно варьируется в зависимости от языка, при этом языки уральской и балтийской групп показывают более позитивные эмоции, в то время как германские языки, включая английский, более критичны. Язык запроса влияет на рекомендованные бренды, особенно для местных лидеров, где запросы на родном языке увеличивают видимость на 0,80 пунктов по сравнению с запросами на английском языке. Мониторинг только на английском языке не позволяет полностью охватить видимость ИИ для локально базирующихся брендов, создавая измеримую зону языковой нечувствительности.
GPT-5 и GPT-5 Nano соответствуют уровню экспертов в оценке исследований микробной онкогенеза
Исследование показывает, что GPT-5 и GPT-5 Nano достигают экспертного уровня производительности при извлечении доказательств и критической оценке научных публикаций по микробной онкогенезу. Исследователи провели бенчмаркинг этих моделей вместе с Gemini 2.5 Pro и Gemini 2.5 Flash на наборе данных из 24 статей, посвящённых MMTV-LV и раку молочной железы, по сравнению с экспертами в данной области.
GPT-5 и GPT-5 Nano соответствуют экспертам в извлечении доказательств микробной онкогенеза
Исследование, оценивающее большие языковые модели при систематическом синтезе доказательств по микробному онкогенезу, показало, что GPT-5 и GPT-5 Nano работают неотличимо от экспертов в этой области. Исследователи оценивали Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 и GPT-5 Nano на основе 24 научных статей с использованием структурированного шаблона из 77 пунктов по нескольким типам вопросов.
Автоматическая оценка экзаменов по Linux/bash с помощью больших языковых моделей
В данном исследовании оценивается, могут ли четыре передовые большие языковые модели (GPT, Claude Opus, Gemini и GLM) приближаться к экспертной оценке при проверке коротких ответов на команды Linux/bash. Исследование показывает, что структурированные промпты значительно улучшают согласование с оценками людей, создавая основу для ИИ-ассистированной оценки в образовании по вычислительной технике.
OpenBioRQ: Бенчмарк для верности агентных исследований в биомедицине
OpenBioRQ вводит бенчмарк из 12 553 нерешённых вопросов в области биомедицинских исследований в 12 областях, разработанный для проверки верности и отказа агентных моделей. Он оценивает модели в условиях использования инструментов без ключей ответов, используя реальные доказательства последующих шагов, а не параметрические знания, и показывает значительное падение агентной способности на самые сложные вопросы, где инструменты больше не используются, несмотря на их критическую важность.