Benchmark · general
IFEval
IFEval (Instruction-Following Eval) mide con qué fiabilidad un modelo de lenguaje obedece instrucciones explícitas de formato y de restricción que una máquina puede comprobar, como reglas de longitud o de formato. La puntuación es el porcentaje de esas instrucciones verificables que el modelo realmente cumple.
Leer más
- Ejemplo
- Una consigna como «Escribe un resumen en exactamente 3 viñetas y sin usar ninguna coma»: el modelo debe producir una respuesta que cumpla cada restricción indicada.
- Puntuación
- Cada respuesta se comprueba automáticamente frente a sus restricciones verificables (número de viñetas, número de palabras, caracteres prohibidos, palabras clave obligatorias, mayúsculas/minúsculas, etc.), y la puntuación es el porcentaje cumplido, informado tanto a nivel de instrucción como a nivel del prompt completo (todas las restricciones cumplidas).
- Verificación
- La verificación es totalmente automática: un pequeño programa determinista comprueba cada restricción (por ejemplo, cuenta las viñetas o busca comas), de modo que no interviene ningún juicio humano ni evaluación por otra LLM.
- Por qué importa
- Separa la capacidad de un modelo para seguir instrucciones precisas de si su respuesta es correcta en cuanto a los hechos, lo cual importa porque cumplir el formato y las restricciones de forma fiable es lo que hace que los modelos sean útiles en aplicaciones reales y flujos automatizados.
Ejemplo resuelto
Tarea
Escribe un breve consejo sobre cómo mantenerte productivo mientras trabajas desde casa, en exactamente dos párrafos. Escribe toda la respuesta en minúsculas lowercase (no se permiten mayúsculas) y no uses ninguna coma en ningún lugar. Termina la respuesta con la frase exacta: 'that is all.'
Solución
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Explicación
La respuesta cumple cada restricción verificable: exactamente dos párrafos, sin mayúsculas, cero comas y la frase final exacta. IFEval evalúa cada instrucción con un verificador determinista en Python e informa la precisión estricta/flexible tanto a nivel de instrucción como de todo el prompt (un prompt cuenta solo si pasan todas las instrucciones).
| Fecha | Modelo | Puntuación | Fuente |
|---|---|---|---|
| 2026-06-30 | Agents-A1 | 80.6pts | Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B |
| 2025-12-15 | GPT-5 | 95.9% | Tsinghua y Ant Group descubren que la fiabilidad de seguimiento de instrucciones de los LLM cae hasta un 61,8 % en indicaciones matizadas |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAI lanza la familia GPT-4.1 con contexto de 1M de tokens y mejoras en programación |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código |