Benchmark · reasoning

BIG-Bench Hard

saturated 5 条结果 4 个模型

BIG-Bench Hard(BBH)是从 BIG-Bench 中挑选出的 23 项高难度任务,早期语言模型在这些任务上无法超过人类评分者的平均水平;它衡量多步推理,并以精确匹配(exact-match)准确率计分。

了解更多
示例
一种任务类型,例如 Boolean Expressions——计算嵌套的 True/False 表达式——以及其他任务,如多步算术、日期理解、逻辑推演、追踪打乱的物体和导航;每项都需要经过若干推理步骤才能得出一个答案。
评分方式
按题计算精确匹配准确率:模型抽取出的最终答案必须与标准答案(多选选项或简短字符串)完全一致。总体分数是 23 项任务准确率的宏平均,通常同时报告直接作答(answer-only)和少样本 chain-of-thought 两种提示方式。
验证方式
只有当抽取出的最终答案字符串与参考答案完全一致时,预测才算正确;结果通常与 BIG-Bench 中人类评分者的平均与最高基线对比,并分别报告 chain-of-thought 与 answer-only。
为何重要
它单独划出模型历来落后于人类的高难度推理子集,也正是在这个场景中证明了 chain-of-thought 能让大模型超过人类评分者的平均水平,因而成为多步推理的标准检验。
示例解析
任务
Boolean Expressions 任务——计算下列布尔表达式的结果:not ( True and False )
解答
步骤 1:True and False = False。步骤 2:not False = True。最终答案:True
解析
布尔运算 'and' 只有在两个操作数都为 True 时才为真,因此 (True and False) 为 False;对 False 取反得到 True。评分方式是最终答案字符串与标准答案精确匹配。
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
时间线
日期 模型 得分 来源
2024-12-17 Falcon3-7B-Base 51.0% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-12-17 Falcon3-10B-Base 59.7% Falcon3 系列发布五款开源模型,提升科学、数学和代码能力
2024-07-15 Qwen2-72B 82.4% Qwen2 技术报告介绍高达 72B 的密集和 MoE 模型
2024-07-15 Qwen2-72B 82.4% Qwen团队发布Qwen2系列,包含72B密集模型和MoE模型
2024-06-20 Claude 3.5 Sonnet 93.1% Anthropic发布Claude 3.5 Sonnet附录,提升编码与视觉基准表现