Muse-Ltd a soumis UncertaintyGym au Hugging Face Evaluation Hub, un nouveau benchmark conçu pour évaluer la calibration métacognitive des grands modèles de langage et leur capacité à exprimer l'incertitude plutôt qu'à halluciner.

Le benchmark catégorise les requêtes en quatre types distincts : questions factuelles résolubles, requêtes insuffisamment spécifiées nécessitant une désambiguïsation, questions à prémisse fausse nécessitant un rejet, et sujets intrinsèquement inconnaissables. Il utilise le Meta Cognitive Calibration Score (MCS) et le Taux d'Hallucination Incontournable comme métriques principales, les lignes de base initiales montrant que le modèle LiquidAI's LFM2.5-2.6B atteint un MCS de 45,0%.

Cette soumission vise à fournir une méthode standardisée pour évaluer dans quelle mesure les modèles gèrent le contexte manquant ou les prémisses impossibles en déclarant explicitement l'inconnaissabilité.