Исследователи представляют GPQA — сложный набор из 448 вопросов с множественным выбором, составленных экспертами в области биологии, физики и химии. Этот бенчмарк разработан как чрезвычайно сложный: эксперты уровня PhD достигают точности лишь 65%, а квалифицированные не-эксперты — 34%, даже при наличии неограниченного доступа к интернету. Современные ИИ-системы также испытывают трудности, и сильнейшая базовая модель GPT-4 достигает точности всего 39%. Эта сложность как для людей, так и для передовых моделей направлена на проведение реалистичных масштабируемых экспериментов по надзору за выводами ИИ в процессе развития научных знаний.
GPQA: Набор вопросов и ответов для выпускников, устойчивый к поиску в Google
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
Исследователь ищет одного независимого аннотатора для разрешения неоднозначности согласия LLM
Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.
Исследование выявляет FragileTokens, не справляющиеся с контекстным копированием, несмотря на успешное прохождение изоляционных тестов
В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.
GPT-5 и GPT-5 Nano соответствуют уровню экспертов в оценке исследований микробной онкогенеза
Исследование показывает, что GPT-5 и GPT-5 Nano достигают экспертного уровня производительности при извлечении доказательств и критической оценке научных публикаций по микробной онкогенезу. Исследователи провели бенчмаркинг этих моделей вместе с Gemini 2.5 Pro и Gemini 2.5 Flash на наборе данных из 24 статей, посвящённых MMTV-LV и раку молочной железы, по сравнению с экспертами в данной области.
GPT-5 и GPT-5 Nano соответствуют экспертам в извлечении доказательств микробной онкогенеза
Исследование, оценивающее большие языковые модели при систематическом синтезе доказательств по микробному онкогенезу, показало, что GPT-5 и GPT-5 Nano работают неотличимо от экспертов в этой области. Исследователи оценивали Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 и GPT-5 Nano на основе 24 научных статей с использованием структурированного шаблона из 77 пунктов по нескольким типам вопросов.
M$^3$R-Bench представляет доказательный бенчмарк для понимания мультимодальных метафор
Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.