Benchmark · reasoning

BIG-Bench Hard

saturated 5 résultats 4 modèles

BIG-Bench Hard (BBH) est un ensemble de 23 tâches difficiles tirées de BIG-Bench sur lesquelles les modèles de langage antérieurs ne parvenaient pas à dépasser l'évaluateur humain moyen ; il mesure le raisonnement en plusieurs étapes et est noté par l'exactitude de correspondance exacte (exact-match).

En savoir plus
Exemple
Un type de tâche comme Boolean Expressions — évaluer une expression imbriquée de True/False —, ainsi que d'autres telles que l'arithmétique en plusieurs étapes, la compréhension des dates, la déduction logique, le suivi d'objets mélangés et la navigation ; chacune exige plusieurs étapes de raisonnement pour parvenir à une réponse.
Notation
Exactitude de correspondance exacte par item : la réponse finale extraite du modèle doit être exactement égale à l'étiquette de référence (une option de choix multiple ou une courte chaîne). Le chiffre principal est l'exactitude macro-moyennée sur les 23 tâches, généralement rapportée à la fois pour l'invite directe (answer-only) et le few-shot chain-of-thought.
Vérification
Une prédiction n'est comptée comme correcte que lorsque la chaîne de la réponse finale extraite correspond exactement à la réponse de référence ; les résultats sont généralement comparés aux références de l'évaluateur humain moyen et maximal de BIG-Bench, et le chain-of-thought et l'answer-only sont rapportés séparément.
Pourquoi c'est important
Il isole le sous-ensemble de raisonnement difficile où les modèles étaient historiquement en retard sur les humains, et c'est le cadre qui a montré que le chain-of-thought peut faire passer les grands modèles au-delà de l'évaluateur humain moyen, en faisant une épreuve standard du raisonnement en plusieurs étapes.
Exemple résolu
Tâche
Tâche Boolean Expressions — Évaluez le résultat de l'expression booléenne suivante : not ( True and False )
Solution
Étape 1 : True and False = False. Étape 2 : not False = True. Réponse finale : True
Explication
Le 'and' booléen vaut False sauf si les deux opérandes sont True, donc (True and False) vaut False ; nier False donne True. La notation est la correspondance exacte de la chaîne de la réponse finale avec l'étiquette de référence.
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
Chronologie
Date Modèle Score Source
2024-12-17 Falcon3-7B-Base 51.0% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-12-17 Falcon3-10B-Base 59.7% La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code
2024-07-15 Qwen2-72B 82.4% Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres
2024-07-15 Qwen2-72B 82.4% L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B
2024-06-20 Claude 3.5 Sonnet 93.1% Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés