Benchmark · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH) est un ensemble de 23 tâches difficiles tirées de BIG-Bench sur lesquelles les modèles de langage antérieurs ne parvenaient pas à dépasser l'évaluateur humain moyen ; il mesure le raisonnement en plusieurs étapes et est noté par l'exactitude de correspondance exacte (exact-match).
En savoir plus
- Exemple
- Un type de tâche comme Boolean Expressions — évaluer une expression imbriquée de True/False —, ainsi que d'autres telles que l'arithmétique en plusieurs étapes, la compréhension des dates, la déduction logique, le suivi d'objets mélangés et la navigation ; chacune exige plusieurs étapes de raisonnement pour parvenir à une réponse.
- Notation
- Exactitude de correspondance exacte par item : la réponse finale extraite du modèle doit être exactement égale à l'étiquette de référence (une option de choix multiple ou une courte chaîne). Le chiffre principal est l'exactitude macro-moyennée sur les 23 tâches, généralement rapportée à la fois pour l'invite directe (answer-only) et le few-shot chain-of-thought.
- Vérification
- Une prédiction n'est comptée comme correcte que lorsque la chaîne de la réponse finale extraite correspond exactement à la réponse de référence ; les résultats sont généralement comparés aux références de l'évaluateur humain moyen et maximal de BIG-Bench, et le chain-of-thought et l'answer-only sont rapportés séparément.
- Pourquoi c'est important
- Il isole le sous-ensemble de raisonnement difficile où les modèles étaient historiquement en retard sur les humains, et c'est le cadre qui a montré que le chain-of-thought peut faire passer les grands modèles au-delà de l'évaluateur humain moyen, en faisant une épreuve standard du raisonnement en plusieurs étapes.
Exemple résolu
Tâche
Tâche Boolean Expressions — Évaluez le résultat de l'expression booléenne suivante : not ( True and False )
Solution
Étape 1 : True and False = False. Étape 2 : not False = True. Réponse finale : True
Explication
Le 'and' booléen vaut False sauf si les deux opérandes sont True, donc (True and False) vaut False ; nier False donne True. La notation est la correspondance exacte de la chaîne de la réponse finale avec l'étiquette de référence.
| Date | Modèle | Score | Source |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code |
| 2024-07-15 | Qwen2-72B | 82.4% | Le rapport technique Qwen2 présente des modèles denses et MoE jusqu'à 72 milliards de paramètres |
| 2024-07-15 | Qwen2-72B | 82.4% | L'équipe Qwen publie la série Qwen2 avec des modèles denses et MoE de 72B |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | Anthropic publie un complément à Claude 3.5 Sonnet avec des benchmarks de codage et de vision améliorés |