Исследователи представляют GPQA — сложный набор из 448 вопросов с множественным выбором, составленных экспертами в области биологии, физики и химии. Этот бенчмарк разработан как чрезвычайно сложный: эксперты уровня PhD достигают точности лишь 65%, а квалифицированные не-эксперты — 34%, даже при наличии неограниченного доступа к интернету. Современные ИИ-системы также испытывают трудности, и сильнейшая базовая модель GPT-4 достигает точности всего 39%. Эта сложность как для людей, так и для передовых моделей направлена на проведение реалистичных масштабируемых экспериментов по надзору за выводами ИИ в процессе развития научных знаний.
GPQA: Набор вопросов и ответов для выпускников, устойчивый к поиску в Google
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench представляет доказательный бенчмарк для понимания мультимодальных метафор
Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.
Фреймворк Zing улучшает социальный интеллект больших языковых моделей с помощью бенчмарка SoMBench и заземления Actio
В докладе представлен Zing, интегрированный фреймворк, разработанный для повышения социального интеллекта больших языковых моделей путём измерения, интериоризации и заземления социальных способностей. Авторы представляют SoMBench — бенчмарк, основанный на психологии, охватывающий 17 вторичных измерений и 3481 экземпляр, верифицированных экспертами, который показывает, что текущие большие языковые модели имеют значительный потенциал для улучшения, ни одна из них не достигла производительности, близкой к максимальному пределу.
Бенчмарк SRRM показывает, что Qwen2.5-1.5B превосходит 3B в долговременной контекстной памяти
Исследователь ищет одобрение arXiv cs.CL для статьи, представляющей Simple Retrieval-Reconstruction Memory (SRRM), легкий бенчмарк, предназначенный для оценки долговременной контекстной памяти в малых языковых моделях.
Тонкая настройка LLM с чертами улучшает оценку эссе по нескольким критериям
Исследователи решают проблему автоматической оценки эссе, когда преподаватели пересматривают или вводят новые критерии, что известно как кросс-рубричная обобщающая способность. Они предлагают фреймворк тонкой настройки для больших языковых моделей, который использует промежуточные представления, не зависящие от конкретных рубрик, называемые «чертами» (traits), вместе с контролем на основе целевых эссе во время обучения.
Отслеживание Гурбани в реальном времени: эталонная система и бенчмарк для субтитрирования сикхского киртана
Авторы представляют эталонную систему и бенчмарк для субтитрирования сикхского киртана в реальном времени, который включает непрерывное пение стихов из Шри Гуру Грант Сахиб Джи. В отличие от транскрипции с открытым словарем, эта задача требует точного пословного совпадения с каноническим писанием, чтобы избежать религиозно неприемлемых опечаток.