Бенчмарк · general

IFEval

6 результатов 6 моделей

IFEval (Instruction-Following Eval) измеряет, насколько надёжно языковая модель выполняет явные, проверяемые программой инструкции по форматированию и ограничениям в запросе — например, правила длины или формата. Оценка — это процент таких проверяемых инструкций, которые модель действительно выполнила.

Подробнее
Пример
Запрос вида «Напиши краткое изложение ровно в 3 пунктах списка и без единой запятой» — модель должна выдать ответ, удовлетворяющий каждому заданному ограничению.
Метрика
Каждый ответ автоматически проверяется на соответствие его проверяемым ограничениям (число пунктов, число слов, запрещённые символы, обязательные ключевые слова, регистр и т. д.), и оценка — это процент выполненных, приводимый как на уровне отдельных инструкций, так и на уровне всего запроса (выполнены все ограничения).
Приёмка
Проверка полностью автоматическая: небольшая детерминированная программа проверяет каждое ограничение (например, считает пункты или ищет запятые), так что человеческого судейства или оценки другой LLM здесь нет.
Почему важно
Он отделяет способность модели следовать точным инструкциям от того, насколько фактически верен её ответ, а это важно, потому что именно надёжное соблюдение формата и ограничений делает модели пригодными для реальных приложений и автоматизированных конвейеров.
Разбор примера
Задача
Напишите короткий совет о том, как сохранять продуктивность при работе из дома, ровно в двух абзацах. Весь ответ должен быть написан строчными буквами lowercase (заглавные буквы запрещены) и не должен содержать ни одной запятой. Завершите ответ точной фразой: 'that is all.'
Решение
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Разбор
Ответ соблюдает каждое проверяемое ограничение: ровно два абзаца, отсутствие заглавных букв, ноль запятых и точная завершающая фраза. IFEval проверяет каждую инструкцию детерминированным Python-верификатором и сообщает строгую/мягкую точность как на уровне инструкций, так и на уровне всего промпта (промпт засчитывается, только если пройдены все инструкции).
0 25 50 75 100 2024-12-17 2025-09-23 2026-06-30 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Falcon3-10B-Instruct · 78 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-06-30
Falcon3-1B-Instruct Falcon3-10B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1
Хронология
Дата Модель Результат Источник
2026-06-30 Agents-A1 80.6pts Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B
2025-12-15 GPT-5 95.9% Исследователи из Цинхуа и Ant Group обнаружили, что надёжность следования инструкциям в LLM снижается до 61,8% на сложных промптах
2025-04-14 GPT-4.1 87.4% OpenAI выпустила семейство GPT-4.1 с контекстом на 1 млн токенов и улучшениями для программирования
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением
2024-12-17 Falcon3-1B-Instruct 54.4% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании
2024-12-17 Falcon3-10B-Instruct 78.0% Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании