벤치마크 · reasoning
BIG-Bench Hard
BIG-Bench Hard(BBH)는 이전 언어 모델이 평균 인간 평가자를 넘지 못했던, BIG-Bench에서 선별한 23개의 어려운 과제 모음으로, 다단계 추론을 측정하며 정확 일치(exact-match) 정확도로 채점합니다.
자세히 보기
- 예시
- Boolean Expressions(중첩된 True/False 식 계산) 같은 과제 유형과 더불어 다단계 산술, 날짜 이해, 논리적 추론, 뒤섞인 물체 추적, 내비게이션 등이 있으며, 각각 하나의 답에 도달하기 위해 여러 추론 단계를 필요로 합니다.
- 채점 방식
- 항목별 정확 일치 정확도: 모델이 추출한 최종 답이 정답 레이블(객관식 보기 또는 짧은 문자열)과 정확히 같아야 합니다. 대표 점수는 23개 과제에 대한 정확도의 매크로 평균이며, 보통 직접 답변(answer-only)과 few-shot chain-of-thought 프롬프트 방식 모두에 대해 보고됩니다.
- 검증 방식
- 추출된 최종 답 문자열이 참조 답과 정확히 일치할 때에만 예측이 정답으로 인정되며, 결과는 보통 BIG-Bench의 평균 및 최대 인간 평가자 기준선과 비교하고 chain-of-thought와 answer-only를 따로 보고합니다.
- 왜 중요한가
- 모델이 역사적으로 사람에게 뒤처졌던 어려운 추론 부분집합을 분리해 낸 것으로, chain-of-thought가 대형 모델을 평균 인간 평가자 이상으로 끌어올릴 수 있음을 보여 준 무대이기도 하여 다단계 추론의 표준 검증 수단이 되었습니다.
예제 풀이
문제
Boolean Expressions 과제 — 다음 불리언 식의 결과를 계산하세요: not ( True and False )
해답
1단계: True and False = False. 2단계: not False = True. 최종 답: True
풀이
불리언 'and'는 두 피연산자가 모두 True가 아니면 False이므로 (True and False)는 False이고, False를 부정하면 True가 됩니다. 채점은 최종 답 문자열과 정답 레이블의 정확 일치입니다.
| 날짜 | 모델 | 점수 | 출처 |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | Falcon3 패밀리가 향상된 과학, 수학, 코드 능력을 갖춘 다섯 가지 오픈 모델을 출시 |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwen2 기술 보고서: 최대 72B 규모의 밀집형 및 MoE 모델 소개 |
| 2024-07-15 | Qwen2-72B | 82.4% | Qwen 팀, 72B 밀집 및 MoE 모델이 포함된 Qwen2 시리즈 출시 |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | Anthropic, Claude 3.5 Sonnet의 향상된 코딩 및 비전 벤치마크를 포함한 추가 문서 출시 |