Benchmark · reasoning

BIG-Bench Hard

saturated 5 hasil 4 model

BIG-Bench Hard (BBH) adalah kumpulan 23 tugas sulit yang diambil dari BIG-Bench, yang pada tugas-tugas itu model bahasa sebelumnya gagal mengalahkan penilai manusia rata-rata; ia mengukur penalaran multi-langkah dan dinilai dengan akurasi kecocokan persis (exact-match).

Selengkapnya
Contoh
Sebuah tipe tugas seperti Boolean Expressions — mengevaluasi ekspresi True/False bertingkat — bersama yang lain seperti aritmetika multi-langkah, pemahaman tanggal, deduksi logis, pelacakan objek yang diacak, dan navigasi; masing-masing membutuhkan beberapa langkah penalaran untuk mencapai satu jawaban.
Penilaian
Akurasi kecocokan persis per butir: jawaban akhir yang diekstrak model harus persis sama dengan label acuan (opsi pilihan ganda atau string pendek). Angka utamanya adalah akurasi rata-rata makro pada 23 tugas, biasanya dilaporkan untuk prompting langsung (answer-only) maupun few-shot chain-of-thought.
Verifikasi
Sebuah prediksi dihitung benar hanya jika string jawaban akhir yang diekstrak persis sama dengan jawaban acuan; hasil biasanya dibandingkan dengan garis dasar penilai manusia rata-rata dan maksimum dari BIG-Bench, serta chain-of-thought dan answer-only dilaporkan terpisah.
Mengapa penting
Ia mengisolasi subset penalaran sulit tempat model secara historis tertinggal dari manusia, dan inilah pengaturan yang menunjukkan bahwa chain-of-thought dapat mendorong model besar melampaui penilai manusia rata-rata, sehingga menjadi uji standar penalaran multi-langkah.
Contoh penyelesaian
Tugas
Tugas Boolean Expressions — Evaluasi hasil ekspresi boolean berikut: not ( True and False )
Solusi
Langkah 1: True and False = False. Langkah 2: not False = True. Jawaban akhir: True
Penjelasan
Operasi boolean 'and' bernilai False kecuali kedua operan bernilai True, jadi (True and False) adalah False; menegasikan False menghasilkan True. Penilaian adalah kecocokan persis string jawaban akhir dengan label acuan.
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
Linimasa
Tanggal Model Skor Sumber
2024-12-17 Falcon3-7B-Base 51.0% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-10B-Base 59.7% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-07-15 Qwen2-72B 82.4% Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B
2024-07-15 Qwen2-72B 82.4% Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B
2024-06-20 Claude 3.5 Sonnet 93.1% Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi