Benchmark · general

IFEval

7 条结果 7 个模型

IFEval(Instruction-Following Eval)衡量语言模型在遵循提示中明确、可由程序核验的格式与约束指令(例如长度或格式规则)方面有多可靠。得分就是模型真正满足的这类可核验指令所占的百分比。

了解更多
示例
例如「用正好 3 个要点写一段摘要,且不使用任何逗号」这样的提示——模型必须给出满足每一条给定约束的回答。
评分方式
每个回答都会自动对照其可核验的约束(要点数量、字数、禁用字符、必含关键词、大小写等)进行检查,得分即满足约束的百分比,并分别在指令级和整条提示级(提示中的全部约束都满足)上报告。
验证方式
核验完全自动化:一个小型的确定性程序逐条检验每个约束(例如数要点数量或检查是否有逗号),因此不涉及任何人工评判或由另一个 LLM 打分。
为何重要
它把模型遵循精确指令的能力与其回答在事实上是否正确区分开来;这很重要,因为可靠地遵守格式与约束正是让模型能用于真实应用和自动化流程的关键。
示例解析
任务
写一条关于在家办公时如何保持高效的简短建议,正好分为两段。整个回答必须全部使用小写字母 lowercase(不允许出现大写字母),并且任何地方都不得使用逗号。回答的结尾必须是这个确切短语:'that is all.'
解答
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
解析
该回答满足每一条可验证的约束:正好两段、没有大写字母、零逗号,以及确切的结尾短语。IFEval 用确定性的 Python 验证器检查每条指令,并在指令层面和整个提示层面分别报告严格/宽松准确率(只有当全部指令都通过时,该提示才算通过)。
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
时间线
日期 模型 得分 来源
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI 发布 LFM2.5-VL-3B,一款支持工具调用的 3B 端侧视觉语言模型
2026-07-06 Agents-A1 80.6pts 扩展视界而非参数量:以35B智能体实现万亿参数级性能
2025-12-15 GPT-5 95.9% 清华与蚂蚁集团发现大语言模型在细微提示下的指令遵循可靠性下降高达61.8%
2025-04-14 GPT-4.1 87.4% OpenAI发布GPT-4.1系列,支持100万token上下文并改进编码能力
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic 发布 Claude 3.7 Sonnet,支持动态推理控制
2024-12-17 Falcon3-10B-Instruct 78.0% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-1B-Instruct 54.4% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力