ベンチマーク · general
IFEval
IFEval(Instruction-Following Eval)は、プロンプト内の明示的で機械的に検証できる書式・制約の指示(長さや形式のルールなど)に、言語モデルがどれだけ確実に従うかを測ります。スコアは、そうした検証可能な指示のうちモデルが実際に満たした割合です。
詳しく見る
- 例
- たとえば「ちょうど3つの箇条書きで要約を書き、カンマを一切使わないこと」というプロンプトでは、モデルは示されたすべての制約を満たす回答を出さなければなりません。
- 採点方法
- 各回答は、その検証可能な制約(箇条書きの数、語数、禁止文字、必須キーワード、大文字小文字など)に照らして自動的にチェックされ、スコアは満たした割合として、指示単位とプロンプト単位(プロンプト内の全制約を満たす)の両方で報告されます。
- 検証方法
- 検証は完全に自動で、小さな決定論的プログラムが各制約を検査する(たとえば箇条書きを数える、カンマを探すなど)ため、人手による判定や別のLLMによる採点は一切ありません。
- 重要な理由
- モデルが正確な指示に従えるかどうかを、回答が事実として正しいかどうかとは切り離して測れる点が重要で、書式や制約を確実に守れることこそが、実際のアプリや自動化されたパイプラインでモデルを使えるものにするからです。
解説付きの例
課題
在宅勤務中に生産性を保つための短いアドバイスを、ちょうど二段落で書いてください。回答全体をすべて小文字 lowercase で書き(大文字は使用不可)、どこにもカンマを使わないでください。回答は必ずこの正確なフレーズで終えてください:'that is all.'
解答
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
解説
この回答は検証可能なすべての制約を満たしています:ちょうど二段落、大文字なし、カンマゼロ、そして正確な結びのフレーズです。IFEval は各指示を決定論的な Python 検証器でチェックし、指示レベルとプロンプト全体レベルの両方で strict/loose の正解率を報告します(すべての指示に合格した場合のみ、そのプロンプトはカウントされます)。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 82.3% | Liquid AIがツール呼び出し機能を備えた3Bのオンデバイスビジョン言語モデルLFM2.5-VL-3Bをリリース |
| 2026-07-06 | Agents-A1 | 80.6pts | パラメータのスケールアップではなくホライゾンの拡張:35Bエージェントでトリリオン・パラメータ級のパフォーマンスを実現 |
| 2025-12-15 | GPT-5 | 95.9% | 清華大学とAnt Group、微妙なプロンプトにおいてLLMの指示フォロー信頼性が最大61.8%低下を確認 |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAIが100万トークンのコンテキストとコーディング改善を備えたGPT-4.1ファミリーをリリース |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropicが動的推論制御機能を備えたClaude 3.7 Sonnetをリリース |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |