벤치마크 · general

IFEval

7 결과 7 모델

IFEval(Instruction-Following Eval)은 언어 모델이 프롬프트에 담긴 명시적이고 기계로 검증 가능한 서식·제약 지시(길이나 형식 규칙 등)를 얼마나 안정적으로 따르는지를 측정합니다. 점수는 그런 검증 가능한 지시 중 모델이 실제로 충족한 비율입니다.

자세히 보기
예시
예를 들어 「정확히 3개의 불릿으로 요약을 쓰고 쉼표는 하나도 쓰지 마시오」 같은 프롬프트에서, 모델은 제시된 모든 제약을 충족하는 답을 내놓아야 합니다.
채점 방식
각 응답은 검증 가능한 제약(불릿 개수, 단어 수, 금지 문자, 필수 키워드, 대소문자 등)에 대해 자동으로 검사되며, 점수는 충족한 비율로서 지시 단위와 프롬프트 단위(프롬프트의 모든 제약 충족) 양쪽으로 보고됩니다.
검증 방식
검증은 완전히 자동입니다. 작은 결정론적 프로그램이 각 제약을 검사하므로(예: 불릿 개수를 세거나 쉼표를 찾음) 사람의 판정이나 다른 LLM의 채점이 전혀 개입하지 않습니다.
왜 중요한가
모델이 정확한 지시를 따를 수 있는지를 그 답이 사실로서 맞는지와 분리해 보여 준다는 점이 중요합니다. 서식과 제약을 안정적으로 지키는 능력이야말로 모델을 실제 앱과 자동화 파이프라인에서 쓸 수 있게 만들기 때문입니다.
예제 풀이
문제
재택근무 중 생산성을 유지하는 방법에 대한 짧은 팁을 정확히 두 단락으로 작성하세요. 답변 전체를 모두 소문자 lowercase 로 작성하고(대문자 사용 금지) 어디에도 쉼표를 사용하지 마세요. 답변은 반드시 이 정확한 문구로 끝내세요: 'that is all.'
해답
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
풀이
이 답변은 검증 가능한 모든 제약을 지킵니다: 정확히 두 단락, 대문자 없음, 쉼표 0개, 그리고 정확한 마지막 문구입니다. IFEval은 각 지시를 결정론적 Python 검증기로 확인하고, 지시 단위와 프롬프트 전체 단위 모두에서 strict/loose 정확도를 보고합니다(모든 지시를 통과해야만 해당 프롬프트가 정답으로 집계됩니다).
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
타임라인
날짜 모델 점수 출처
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI가 도구 호출 기능을 갖춘 3B 온디바이스 비전-언어 모델 LFM2.5-VL-3B 출시
2026-07-06 Agents-A1 80.6pts 파라미터가 아닌 에이전트 지평 확장: 35B 에이전트로 트릴리언 파라미터 성능 달성
2025-12-15 GPT-5 95.9% 칭화대 및 안트그룹, 미묘한 프롬프트에서 LLM 지시 따르기 신뢰도 최대 61.8% 하락 발견
2025-04-14 GPT-4.1 87.4% OpenAI, 100만 토큰 컨텍스트 및 코딩 개선 기능을 갖춘 GPT-4.1 패밀리 출시
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic, 동적 추론 제어가 가능한 Claude 3.7 Sonnet 출시
2024-12-17 Falcon3-10B-Instruct 78.0% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시
2024-12-17 Falcon3-1B-Instruct 54.4% Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시