Бенчмарк · general
IFEval
IFEval (Instruction-Following Eval) измеряет, насколько надёжно языковая модель выполняет явные, проверяемые программой инструкции по форматированию и ограничениям в запросе — например, правила длины или формата. Оценка — это процент таких проверяемых инструкций, которые модель действительно выполнила.
Подробнее
- Пример
- Запрос вида «Напиши краткое изложение ровно в 3 пунктах списка и без единой запятой» — модель должна выдать ответ, удовлетворяющий каждому заданному ограничению.
- Метрика
- Каждый ответ автоматически проверяется на соответствие его проверяемым ограничениям (число пунктов, число слов, запрещённые символы, обязательные ключевые слова, регистр и т. д.), и оценка — это процент выполненных, приводимый как на уровне отдельных инструкций, так и на уровне всего запроса (выполнены все ограничения).
- Приёмка
- Проверка полностью автоматическая: небольшая детерминированная программа проверяет каждое ограничение (например, считает пункты или ищет запятые), так что человеческого судейства или оценки другой LLM здесь нет.
- Почему важно
- Он отделяет способность модели следовать точным инструкциям от того, насколько фактически верен её ответ, а это важно, потому что именно надёжное соблюдение формата и ограничений делает модели пригодными для реальных приложений и автоматизированных конвейеров.
Разбор примера
Задача
Напишите короткий совет о том, как сохранять продуктивность при работе из дома, ровно в двух абзацах. Весь ответ должен быть написан строчными буквами lowercase (заглавные буквы запрещены) и не должен содержать ни одной запятой. Завершите ответ точной фразой: 'that is all.'
Решение
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Разбор
Ответ соблюдает каждое проверяемое ограничение: ровно два абзаца, отсутствие заглавных букв, ноль запятых и точная завершающая фраза. IFEval проверяет каждую инструкцию детерминированным Python-верификатором и сообщает строгую/мягкую точность как на уровне инструкций, так и на уровне всего промпта (промпт засчитывается, только если пройдены все инструкции).
| Дата | Модель | Результат | Источник |
|---|---|---|---|
| 2026-06-30 | Agents-A1 | 80.6pts | Масштабирование горизонта, а не параметров: достижение производительности триллионных моделей с агентом на 35B |
| 2025-12-15 | GPT-5 | 95.9% | Исследователи из Цинхуа и Ant Group обнаружили, что надёжность следования инструкциям в LLM снижается до 61,8% на сложных промптах |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAI выпустила семейство GPT-4.1 с контекстом на 1 млн токенов и улучшениями для программирования |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropic выпустила Claude 3.7 Sonnet с динамическим управлением рассуждением |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | Семейство Falcon3 выпускает пять открытых моделей с улучшенными возможностями в науке, математике и программировании |