Бенчмарк · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH) — набор из 23 сложных задач, отобранных из BIG-Bench, на которых прежние языковые модели не превосходили среднего человека-оценщика; он измеряет многошаговое рассуждение и оценивается по точности точного совпадения (exact-match).
Подробнее
- Пример
- Тип задачи, например Boolean Expressions — вычисление вложенного выражения из True/False, — а также другие: многошаговая арифметика, понимание дат, логический вывод, отслеживание перемешанных объектов и навигация; каждая требует нескольких шагов рассуждения ради одного ответа.
- Метрика
- Точность точного совпадения по каждому пункту: извлечённый финальный ответ модели должен в точности совпадать с эталонной меткой (вариант из множественного выбора или короткая строка). Итоговое число — макро-среднее точности по 23 задачам, обычно приводимое как для прямого ответа (answer-only), так и для few-shot chain-of-thought.
- Приёмка
- Предсказание засчитывается верным, только если извлечённая строка финального ответа в точности совпадает с эталонным ответом; результаты обычно сравнивают со средним и максимальным уровнем человека-оценщика из BIG-Bench, а chain-of-thought и answer-only приводят отдельно.
- Почему важно
- Он выделяет подмножество трудных задач на рассуждение, где модели исторически уступали людям, и именно на нём было показано, что chain-of-thought позволяет крупным моделям превзойти среднего человека-оценщика — поэтому он стал стандартной проверкой многошагового рассуждения.
Разбор примера
Задача
Задача Boolean Expressions — вычислите результат следующего булева выражения: not ( True and False )
Решение
Шаг 1: True and False = False. Шаг 2: not False = True. Итоговый ответ: True
Разбор
Булево 'and' даёт False, если хотя бы один операнд не True, поэтому (True and False) = False; отрицание False даёт True. Оценка — точное совпадение строки финального ответа с эталонной меткой.
| Дата | Модель | Результат | Источник |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании |
| 2024-07-15 | Qwen2-72B | 82.4% | Технический отчет Qwen2 представляет плотные и MoE модели до 72B |
| 2024-07-15 | Qwen2-72B | 82.4% | Команда Qwen выпустила серию Qwen2 с моделями на 72B (плотными и MoE) |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | Anthropic выпустила дополнение к Claude 3.5 Sonnet с улучшенными показателями в задачах программирования и зрения |