Benchmark · general

IFEval

7 hasil 7 model

IFEval (Instruction-Following Eval) mengukur seberapa andal sebuah model bahasa mematuhi instruksi format dan batasan yang eksplisit serta dapat diperiksa oleh mesin dalam sebuah prompt, seperti aturan panjang atau format. Skornya adalah persentase instruksi terverifikasi tersebut yang benar-benar dipenuhi model.

Selengkapnya
Contoh
Sebuah prompt seperti «Tulis ringkasan dalam tepat 3 poin bulatan dan tanpa memakai satu koma pun» — model harus menghasilkan jawaban yang memenuhi setiap batasan yang disebutkan.
Penilaian
Setiap jawaban diperiksa secara otomatis terhadap batasan-batasannya yang terverifikasi (jumlah poin, jumlah kata, karakter terlarang, kata kunci wajib, huruf besar/kecil, dsb.), dan skornya adalah persentase yang terpenuhi, dilaporkan baik di tingkat instruksi maupun tingkat prompt utuh (semua batasan terpenuhi).
Verifikasi
Verifikasi sepenuhnya otomatis: sebuah program deterministik kecil menguji setiap batasan (misalnya menghitung poin atau mencari koma), sehingga tidak ada penilaian manusia maupun pemberian nilai oleh LLM lain.
Mengapa penting
Ia memisahkan kemampuan model mengikuti instruksi yang tepat dari apakah jawabannya benar secara faktual; ini penting karena kepatuhan yang andal pada format dan batasan itulah yang membuat model dapat dipakai di aplikasi nyata dan alur otomatis.
Contoh penyelesaian
Tugas
Tulis satu tip singkat tentang cara tetap produktif saat bekerja dari rumah, dalam tepat dua paragraf. Tulis seluruh jawaban dalam huruf kecil lowercase (huruf kapital tidak diperbolehkan) dan jangan gunakan koma di mana pun. Akhiri jawaban dengan frasa yang persis: 'that is all.'
Solusi
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
Penjelasan
Jawaban ini mematuhi setiap batasan yang dapat diverifikasi: tepat dua paragraf, tanpa huruf kapital, nol koma, dan frasa penutup yang persis. IFEval menilai setiap instruksi dengan verifier Python yang deterministik dan melaporkan akurasi strict/loose baik pada tingkat instruksi maupun tingkat seluruh prompt (sebuah prompt hanya dihitung jika semua instruksinya lolos).
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
Linimasa
Tanggal Model Skor Sumber
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI merilis LFM2.5-VL-3B, model visi-bahasa 3B untuk perangkat dengan kemampuan pemanggilan alat
2026-07-06 Agents-A1 80.6pts Memperluas Horizon, Bukan Parameter: Mencapai Kinerja Triliun-Parameter dengan Agen 35B
2025-12-15 GPT-5 95.9% Tsinghua dan Ant Group menemukan keandalan mengikuti instruksi LLM turun hingga 61,8% pada prompt bernuansa
2025-04-14 GPT-4.1 87.4% OpenAI merilis keluarga GPT-4.1 dengan konteks 1M token dan peningkatan pemrograman
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic merilis Claude 3.7 Sonnet dengan kontrol penalaran dinamis
2024-12-17 Falcon3-10B-Instruct 78.0% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik
2024-12-17 Falcon3-1B-Instruct 54.4% Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik