Muse-Ltd ha enviado UncertaintyGym al Hugging Face Evaluation Hub, un nuevo benchmark diseñado para evaluar la calibración metacognitiva de los modelos de lenguaje grandes y su capacidad para expresar incertidumbre en lugar de alucinar.
El benchmark clasifica las consultas en cuatro tipos distintos: preguntas factivas resolubles, consultas insuficientemente especificadas que requieren desambiguación, preguntas con premisas falsas que necesitan ser rechazadas y temas inherentemente insondables. Utiliza el Meta Cognitive Calibration Score (MCS) y la Tasa de Alucinación Incontestable como métricas principales, con líneas base iniciales que muestran que el modelo LiquidAI's LFM2.5-2.6B alcanza un MCS del 45,0%.
Esta presentación tiene como objetivo proporcionar un método estandarizado para evaluar qué tan bien los modelos manejan contextos faltantes o premisas imposibles declarando explícitamente la insondabilidad.