ベンチマーク · reasoning
BIG-Bench Hard
BIG-Bench Hard(BBH)は、以前の言語モデルが平均的な人間評価者を上回れなかった、BIG-Bench から選ばれた23個の難しいタスク集で、多段階推論を測定し、完全一致(exact-match)の正解率で採点します。
詳しく見る
- 例
- Boolean Expressions(入れ子になった True/False 式の評価)のようなタスク種別に加え、多段階算術、日付理解、論理的推論、シャッフルされた物体の追跡、ナビゲーションなどがあり、いずれも1つの答えに到達するのに複数の推論ステップを要します。
- 採点方法
- 項目ごとの完全一致正解率:モデルが抽出した最終回答が、正解ラベル(多肢選択の選択肢または短い文字列)と完全に一致する必要があります。代表値は23タスクにわたる正解率のマクロ平均で、通常は直接回答(answer-only)と few-shot chain-of-thought の両プロンプト方式について報告されます。
- 検証方法
- 予測は、抽出された最終回答文字列が参照回答と完全に一致した場合のみ正解とみなされます。結果は通常、BIG-Bench の平均および最高の人間評価者ベースラインと比較され、chain-of-thought と answer-only は別々に報告されます。
- 重要な理由
- モデルが従来人間に後れを取っていた難しい推論の部分集合を切り出したもので、chain-of-thought によって大規模モデルが平均的な人間評価者を上回れることを示した場面でもあり、多段階推論の標準的な検証手段となっています。
解説付きの例
課題
Boolean Expressions タスク — 次のブール式の結果を評価してください: not ( True and False )
解答
ステップ1: True and False = False。ステップ2: not False = True。最終回答: True
解説
ブール演算の 'and' は両オペランドが True でない限り False になるため、(True and False) は False となり、False の否定は True になります。採点は最終回答文字列と正解ラベルの完全一致です。
| 日付 | モデル | スコア | ソース |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | Falcon3ファミリーが科学、数学、コード能力を強化した5つのオープンモデルをリリース |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwen2技術レポートは72Bまでの密集型およびMoEモデルを紹介 |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwenチームが72BのDenseおよびMoEモデルを含むQwen2シリーズをリリース |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | AnthropicがClaude 3.5 Sonnetの補遺をリリースし、コーディングとビジョンベンチマークが改善 |