Benchmark · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH) es un conjunto de 23 tareas difíciles extraídas de BIG-Bench en las que los modelos de lenguaje anteriores no lograban superar al evaluador humano promedio; mide el razonamiento de varios pasos y se puntúa por precisión de coincidencia exacta (exact-match).
Leer más
- Ejemplo
- Un tipo de tarea como Boolean Expressions —evaluar una expresión anidada de True/False—, junto a otras como aritmética de varios pasos, comprensión de fechas, deducción lógica, seguimiento de objetos barajados y navegación; cada una requiere varios pasos de razonamiento para llegar a una respuesta.
- Puntuación
- Precisión de coincidencia exacta por ítem: la respuesta final extraída del modelo debe ser exactamente igual a la etiqueta de referencia (una opción de opción múltiple o una cadena corta). La cifra principal es la precisión macropromediada sobre las 23 tareas, normalmente reportada tanto para el prompting directo (answer-only) como para el few-shot chain-of-thought.
- Verificación
- Una predicción se considera correcta solo cuando la cadena de la respuesta final extraída coincide exactamente con la respuesta de referencia; los resultados suelen compararse con las líneas base del evaluador humano promedio y máximo de BIG-Bench, y el chain-of-thought y el answer-only se reportan por separado.
- Por qué importa
- Aísla el subconjunto de razonamiento difícil donde los modelos históricamente iban por detrás de las personas, y fue el escenario que mostró que el chain-of-thought puede llevar a los modelos grandes más allá del evaluador humano promedio, convirtiéndolo en una prueba estándar del razonamiento de varios pasos.
Ejemplo resuelto
Tarea
Tarea Boolean Expressions — Evalúa el resultado de la siguiente expresión booleana: not ( True and False )
Solución
Paso 1: True and False = False. Paso 2: not False = True. Respuesta final: True
Explicación
El 'and' booleano da False salvo que ambos operandos sean True, así que (True and False) es False; negar False da True. La calificación es la coincidencia exacta de la cadena de la respuesta final con la etiqueta de referencia.
| Fecha | Modelo | Puntuación | Fuente |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código |
| 2024-07-15 | Qwen2-72B | 82.4% | El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B |
| 2024-07-15 | Qwen2-72B | 82.4% | El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión |