Benchmark · general

IFEval

6 resultados 6 modelos

IFEval (Instruction-Following Eval) mide con qué fiabilidad un modelo de lenguaje obedece instrucciones explícitas de formato y de restricción que una máquina puede comprobar, como reglas de longitud o de formato. La puntuación es el porcentaje de esas instrucciones verificables que el modelo realmente cumple.

Leer más
Ejemplo
Una consigna como «Escribe un resumen en exactamente 3 viñetas y sin usar ninguna coma»: el modelo debe producir una respuesta que cumpla cada restricción indicada.
Puntuación
Cada respuesta se comprueba automáticamente frente a sus restricciones verificables (número de viñetas, número de palabras, caracteres prohibidos, palabras clave obligatorias, mayúsculas/minúsculas, etc.), y la puntuación es el porcentaje cumplido, informado tanto a nivel de instrucción como a nivel del prompt completo (todas las restricciones cumplidas).
Verificación
La verificación es totalmente automática: un pequeño programa determinista comprueba cada restricción (por ejemplo, cuenta las viñetas o busca comas), de modo que no interviene ningún juicio humano ni evaluación por otra LLM.
Por qué importa
Separa la capacidad de un modelo para seguir instrucciones precisas de si su respuesta es correcta en cuanto a los hechos, lo cual importa porque cumplir el formato y las restricciones de forma fiable es lo que hace que los modelos sean útiles en aplicaciones reales y flujos automatizados.
Ejemplo resuelto
Tarea
Escribe un breve consejo sobre cómo mantenerte productivo mientras trabajas desde casa, en exactamente dos párrafos. Escribe toda la respuesta en minúsculas lowercase (no se permiten mayúsculas) y no uses ninguna coma en ningún lugar. Termina la respuesta con la frase exacta: 'that is all.'
Solución
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Explicación
La respuesta cumple cada restricción verificable: exactamente dos párrafos, sin mayúsculas, cero comas y la frase final exacta. IFEval evalúa cada instrucción con un verificador determinista en Python e informa la precisión estricta/flexible tanto a nivel de instrucción como de todo el prompt (un prompt cuenta solo si pasan todas las instrucciones).
0 25 50 75 100 2024-12-17 2025-09-23 2026-06-30 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Falcon3-10B-Instruct · 78 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-06-30
Falcon3-1B-Instruct Falcon3-10B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1
Cronología
Fecha Modelo Puntuación Fuente
2026-06-30 Agents-A1 80.6pts Escalar el horizonte, no los parámetros: alcanzar rendimiento de billones de parámetros con un agente de 35B
2025-12-15 GPT-5 95.9% Tsinghua y Ant Group descubren que la fiabilidad de seguimiento de instrucciones de los LLM cae hasta un 61,8 % en indicaciones matizadas
2025-04-14 GPT-4.1 87.4% OpenAI lanza la familia GPT-4.1 con contexto de 1M de tokens y mejoras en programación
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic lanza Claude 3.7 Sonnet con control dinámico de razonamiento
2024-12-17 Falcon3-1B-Instruct 54.4% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-10B-Instruct 78.0% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código