Benchmark · general
IFEval
O IFEval (Instruction-Following Eval) mede o quão confiavelmente um modelo de linguagem obedece a instruções explícitas de formato e de restrição que uma máquina consegue verificar em um prompt, como regras de tamanho ou de formato. A pontuação é a porcentagem dessas instruções verificáveis que o modelo de fato cumpre.
Saiba mais
- Exemplo
- Um comando como «Escreva um resumo em exatamente 3 marcadores e sem usar nenhuma vírgula» — o modelo precisa produzir uma resposta que atenda a cada restrição indicada.
- Pontuação
- Cada resposta é verificada automaticamente contra suas restrições verificáveis (quantidade de marcadores, número de palavras, caracteres proibidos, palavras-chave obrigatórias, maiúsculas/minúsculas etc.), e a pontuação é a porcentagem cumprida, informada tanto no nível da instrução quanto no nível do prompt inteiro (todas as restrições atendidas).
- Verificação
- A verificação é totalmente automática: um pequeno programa determinístico testa cada restrição (por exemplo, conta os marcadores ou procura vírgulas), de modo que não há julgamento humano nem avaliação por outra LLM.
- Por que importa
- Ele separa a capacidade do modelo de seguir instruções precisas do fato de a resposta estar factualmente correta, o que importa porque cumprir formato e restrições de forma confiável é o que torna os modelos úteis em aplicações reais e pipelines automatizados.
Exemplo resolvido
Tarefa
Escreva uma dica curta sobre como se manter produtivo trabalhando de casa, em exatamente dois parágrafos. Escreva toda a resposta em letras minúsculas lowercase (letras maiúsculas não são permitidas) e não use nenhuma vírgula em lugar algum. Termine a resposta com a frase exata: 'that is all.'
Solução
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Explicação
A resposta obedece a cada restrição verificável: exatamente dois parágrafos, sem letras maiúsculas, zero vírgulas e a frase final exata. O IFEval avalia cada instrução com um verificador determinístico em Python e reporta a precisão estrita/flexível tanto no nível da instrução quanto no do prompt inteiro (um prompt só conta se todas as instruções passarem).
| Data | Modelo | Pontuação | Fonte |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 82.3% | Liquid AI lança LFM2.5-VL-3B, um modelo de visão e linguagem de 3B para dispositivos móveis com chamada de ferramentas |
| 2026-07-06 | Agents-A1 | 80.6pts | Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B |
| 2025-12-15 | GPT-5 | 95.9% | Tsinghua e Ant Group descobem que a confiabilidade de modelos de linguagem grandes na execução de instruções cai até 61,8% em prompts sutis |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAI lança família GPT-4.1 com contexto de 1M de tokens e melhorias em codificação |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código |