Muse-Ltdは、大規模言語モデルのメタ認知キャリブレーションと、幻覚ではなく不確実性を表現する能力を評価するために設計された新しいベンチマークであるUncertaintyGymをHugging Face Evaluation Hubに提出しました。

このベンチマークは、クエリを4つの異なるタイプに分類します:解決可能な事実質問、曖昧さ解消が必要な未指定のクエリ、拒否が必要な誤った前提の質問、そして本質的に未知のトピックです。主要指標としてメタ認知キャリブレーションスコア(MCS)と回答不能な幻覚率を使用し、初期ベースラインではLiquidAI's LFM2.5-2.6Bモデルが45.0%のMCSを達成していることが示されています。

この提出は、不明瞭性を明示的に宣言することで、欠落したコンテキストや不可能な前提をモデルがどの程度処理できるかを評価するための標準化された方法を提供することを目的としています。