Benchmark · reasoning
BIG-Bench Hard
BIG-Bench Hard (BBH) adalah kumpulan 23 tugas sulit yang diambil dari BIG-Bench, yang pada tugas-tugas itu model bahasa sebelumnya gagal mengalahkan penilai manusia rata-rata; ia mengukur penalaran multi-langkah dan dinilai dengan akurasi kecocokan persis (exact-match).
Selengkapnya
- Contoh
- Sebuah tipe tugas seperti Boolean Expressions — mengevaluasi ekspresi True/False bertingkat — bersama yang lain seperti aritmetika multi-langkah, pemahaman tanggal, deduksi logis, pelacakan objek yang diacak, dan navigasi; masing-masing membutuhkan beberapa langkah penalaran untuk mencapai satu jawaban.
- Penilaian
- Akurasi kecocokan persis per butir: jawaban akhir yang diekstrak model harus persis sama dengan label acuan (opsi pilihan ganda atau string pendek). Angka utamanya adalah akurasi rata-rata makro pada 23 tugas, biasanya dilaporkan untuk prompting langsung (answer-only) maupun few-shot chain-of-thought.
- Verifikasi
- Sebuah prediksi dihitung benar hanya jika string jawaban akhir yang diekstrak persis sama dengan jawaban acuan; hasil biasanya dibandingkan dengan garis dasar penilai manusia rata-rata dan maksimum dari BIG-Bench, serta chain-of-thought dan answer-only dilaporkan terpisah.
- Mengapa penting
- Ia mengisolasi subset penalaran sulit tempat model secara historis tertinggal dari manusia, dan inilah pengaturan yang menunjukkan bahwa chain-of-thought dapat mendorong model besar melampaui penilai manusia rata-rata, sehingga menjadi uji standar penalaran multi-langkah.
Contoh penyelesaian
Tugas
Tugas Boolean Expressions — Evaluasi hasil ekspresi boolean berikut: not ( True and False )
Solusi
Langkah 1: True and False = False. Langkah 2: not False = True. Jawaban akhir: True
Penjelasan
Operasi boolean 'and' bernilai False kecuali kedua operan bernilai True, jadi (True and False) adalah False; menegasikan False menghasilkan True. Penilaian adalah kecocokan persis string jawaban akhir dengan label acuan.
| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2024-12-17 | Falcon3-7B-Base | 51.0% | Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik |
| 2024-12-17 | Falcon3-10B-Base | 59.7% | Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik |
| 2024-07-15 | Qwen2-72B | 82.4% | Laporan Teknis Qwen2 memperkenalkan model padat dan MoE hingga 72B |
| 2024-07-15 | Qwen2-72B | 82.4% | Tim Qwen merilis seri Qwen2 dengan model padat dan MoE 72B |
| 2024-06-20 | Claude 3.5 Sonnet | 93.1% | Anthropic merilis tambahan untuk Claude 3.5 Sonnet dengan peningkatan benchmark pemrograman dan visi |