Muse-Ltd telah menyerahkan UncertaintyGym ke Hugging Face Evaluation Hub, sebuah benchmark baru yang dirancang untuk mengevaluasi kalibrasi metakognitif model bahasa besar dan kemampuan mereka untuk menyatakan ketidakpastian daripada berhalusinasi.
Benchmark ini mengkategorikan kueri menjadi empat jenis berbeda: pertanyaan faktual yang dapat dipecahkan, kueri yang kurang ditentukan yang memerlukan disambiguasi, pertanyaan dengan premis palsu yang perlu ditolak, dan topik yang secara inheren tidak dapat diketahui. Ini menggunakan Skor Kalibrasi Metakognitif (MCS) dan Tingkat Hallusinasi Tidak Terjawab sebagai metrik utama, dengan baseline awal menunjukkan bahwa model LiquidAI's LFM2.5-2.6B mencapai MCS 45,0%.
Pengiriman ini bertujuan untuk menyediakan metode standar untuk menilai seberapa baik model menangani konteks yang hilang atau premis yang mustahil dengan secara eksplisit menyatakan ketidakmampuan untuk diketahui.