Benchmark · general

IFEval

7 resultados 7 modelos

O IFEval (Instruction-Following Eval) mede o quão confiavelmente um modelo de linguagem obedece a instruções explícitas de formato e de restrição que uma máquina consegue verificar em um prompt, como regras de tamanho ou de formato. A pontuação é a porcentagem dessas instruções verificáveis que o modelo de fato cumpre.

Saiba mais
Exemplo
Um comando como «Escreva um resumo em exatamente 3 marcadores e sem usar nenhuma vírgula» — o modelo precisa produzir uma resposta que atenda a cada restrição indicada.
Pontuação
Cada resposta é verificada automaticamente contra suas restrições verificáveis (quantidade de marcadores, número de palavras, caracteres proibidos, palavras-chave obrigatórias, maiúsculas/minúsculas etc.), e a pontuação é a porcentagem cumprida, informada tanto no nível da instrução quanto no nível do prompt inteiro (todas as restrições atendidas).
Verificação
A verificação é totalmente automática: um pequeno programa determinístico testa cada restrição (por exemplo, conta os marcadores ou procura vírgulas), de modo que não há julgamento humano nem avaliação por outra LLM.
Por que importa
Ele separa a capacidade do modelo de seguir instruções precisas do fato de a resposta estar factualmente correta, o que importa porque cumprir formato e restrições de forma confiável é o que torna os modelos úteis em aplicações reais e pipelines automatizados.
Exemplo resolvido
Tarefa
Escreva uma dica curta sobre como se manter produtivo trabalhando de casa, em exatamente dois parágrafos. Escreva toda a resposta em letras minúsculas lowercase (letras maiúsculas não são permitidas) e não use nenhuma vírgula em lugar algum. Termine a resposta com a frase exata: 'that is all.'
Solução
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Explicação
A resposta obedece a cada restrição verificável: exatamente dois parágrafos, sem letras maiúsculas, zero vírgulas e a frase final exata. O IFEval avalia cada instrução com um verificador determinístico em Python e reporta a precisão estrita/flexível tanto no nível da instrução quanto no do prompt inteiro (um prompt só conta se todas as instruções passarem).
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
Linha do tempo
Data Modelo Pontuação Fonte
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI lança LFM2.5-VL-3B, um modelo de visão e linguagem de 3B para dispositivos móveis com chamada de ferramentas
2026-07-06 Agents-A1 80.6pts Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhões de Parâmetros com um Agente de 35B
2025-12-15 GPT-5 95.9% Tsinghua e Ant Group descobem que a confiabilidade de modelos de linguagem grandes na execução de instruções cai até 61,8% em prompts sutis
2025-04-14 GPT-4.1 87.4% OpenAI lança família GPT-4.1 com contexto de 1M de tokens e melhorias em codificação
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
2024-12-17 Falcon3-10B-Instruct 78.0% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-1B-Instruct 54.4% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código