A Muse-Ltd submeteu o UncertaintyGym ao Hugging Face Evaluation Hub, um novo benchmark projetado para avaliar a calibração metacognitiva de grandes modelos de linguagem e sua capacidade de expressar incerteza em vez de alucinar.

O benchmark categoriza as consultas em quatro tipos distintos: perguntas factuais solucionáveis, consultas insuficientemente especificadas que requerem desambiguação, perguntas com premissas falsas que precisam ser rejeitadas e temas inerentemente desconhecíveis. Ele utiliza o Meta Cognitive Calibration Score (MCS) e a Taxa de Alucinação Incontestável como métricas principais, com linhas de base iniciais mostrando que o modelo LiquidAI's LFM2.5-2.6B alcançou um MCS de 45,0%.

Esta submissão visa fornecer um método padronizado para avaliar quão bem os modelos lidam com contexto ausente ou premissas impossíveis, declarando explicitamente a desconhecibilidade.