Benchmark · reasoning

BIG-Bench Hard

saturated 5 resultados 4 modelos

BIG-Bench Hard (BBH) es un conjunto de 23 tareas difíciles extraídas de BIG-Bench en las que los modelos de lenguaje anteriores no lograban superar al evaluador humano promedio; mide el razonamiento de varios pasos y se puntúa por precisión de coincidencia exacta (exact-match).

Leer más
Ejemplo
Un tipo de tarea como Boolean Expressions —evaluar una expresión anidada de True/False—, junto a otras como aritmética de varios pasos, comprensión de fechas, deducción lógica, seguimiento de objetos barajados y navegación; cada una requiere varios pasos de razonamiento para llegar a una respuesta.
Puntuación
Precisión de coincidencia exacta por ítem: la respuesta final extraída del modelo debe ser exactamente igual a la etiqueta de referencia (una opción de opción múltiple o una cadena corta). La cifra principal es la precisión macropromediada sobre las 23 tareas, normalmente reportada tanto para el prompting directo (answer-only) como para el few-shot chain-of-thought.
Verificación
Una predicción se considera correcta solo cuando la cadena de la respuesta final extraída coincide exactamente con la respuesta de referencia; los resultados suelen compararse con las líneas base del evaluador humano promedio y máximo de BIG-Bench, y el chain-of-thought y el answer-only se reportan por separado.
Por qué importa
Aísla el subconjunto de razonamiento difícil donde los modelos históricamente iban por detrás de las personas, y fue el escenario que mostró que el chain-of-thought puede llevar a los modelos grandes más allá del evaluador humano promedio, convirtiéndolo en una prueba estándar del razonamiento de varios pasos.
Ejemplo resuelto
Tarea
Tarea Boolean Expressions — Evalúa el resultado de la siguiente expresión booleana: not ( True and False )
Solución
Paso 1: True and False = False. Paso 2: not False = True. Respuesta final: True
Explicación
El 'and' booleano da False salvo que ambos operandos sean True, así que (True and False) es False; negar False da True. La calificación es la coincidencia exacta de la cadena de la respuesta final con la etiqueta de referencia.
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
Cronología
Fecha Modelo Puntuación Fuente
2024-12-17 Falcon3-7B-Base 51.0% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-12-17 Falcon3-10B-Base 59.7% La familia Falcon3 lanza cinco modelos abiertos con mejores capacidades en ciencia, matemáticas y código
2024-07-15 Qwen2-72B 82.4% El informe técnico de Qwen2 presenta modelos densos y MoE de hasta 72B
2024-07-15 Qwen2-72B 82.4% El equipo de Qwen lanza la serie Qwen2 con modelos densos y MoE de 72B
2024-06-20 Claude 3.5 Sonnet 93.1% Anthropic lanza un apéndice de Claude 3.5 Sonnet con mejores benchmarks de codificación y visión