벤치마크 · general
IFEval
IFEval(Instruction-Following Eval)은 언어 모델이 프롬프트에 담긴 명시적이고 기계로 검증 가능한 서식·제약 지시(길이나 형식 규칙 등)를 얼마나 안정적으로 따르는지를 측정합니다. 점수는 그런 검증 가능한 지시 중 모델이 실제로 충족한 비율입니다.
자세히 보기
- 예시
- 예를 들어 「정확히 3개의 불릿으로 요약을 쓰고 쉼표는 하나도 쓰지 마시오」 같은 프롬프트에서, 모델은 제시된 모든 제약을 충족하는 답을 내놓아야 합니다.
- 채점 방식
- 각 응답은 검증 가능한 제약(불릿 개수, 단어 수, 금지 문자, 필수 키워드, 대소문자 등)에 대해 자동으로 검사되며, 점수는 충족한 비율로서 지시 단위와 프롬프트 단위(프롬프트의 모든 제약 충족) 양쪽으로 보고됩니다.
- 검증 방식
- 검증은 완전히 자동입니다. 작은 결정론적 프로그램이 각 제약을 검사하므로(예: 불릿 개수를 세거나 쉼표를 찾음) 사람의 판정이나 다른 LLM의 채점이 전혀 개입하지 않습니다.
- 왜 중요한가
- 모델이 정확한 지시를 따를 수 있는지를 그 답이 사실로서 맞는지와 분리해 보여 준다는 점이 중요합니다. 서식과 제약을 안정적으로 지키는 능력이야말로 모델을 실제 앱과 자동화 파이프라인에서 쓸 수 있게 만들기 때문입니다.
예제 풀이
문제
재택근무 중 생산성을 유지하는 방법에 대한 짧은 팁을 정확히 두 단락으로 작성하세요. 답변 전체를 모두 소문자 lowercase 로 작성하고(대문자 사용 금지) 어디에도 쉼표를 사용하지 마세요. 답변은 반드시 이 정확한 문구로 끝내세요: 'that is all.'
해답
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
풀이
이 답변은 검증 가능한 모든 제약을 지킵니다: 정확히 두 단락, 대문자 없음, 쉼표 0개, 그리고 정확한 마지막 문구입니다. IFEval은 각 지시를 결정론적 Python 검증기로 확인하고, 지시 단위와 프롬프트 전체 단위 모두에서 strict/loose 정확도를 보고합니다(모든 지시를 통과해야만 해당 프롬프트가 정답으로 집계됩니다).
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 82.3% | Liquid AI가 도구 호출 기능을 갖춘 3B 온디바이스 비전-언어 모델 LFM2.5-VL-3B 출시 |
| 2026-07-06 | Agents-A1 | 80.6pts | 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성 |
| 2025-12-15 | GPT-5 | 95.9% | 칭화대 및 안트그룹, 미묘한 프롬프트에서 LLM 지시 따르기 신뢰도 최대 61.8% 하락 발견 |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAI, 100만 토큰 컨텍스트 및 코딩 개선 기능을 갖춘 GPT-4.1 패밀리 출시 |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시 |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |