SciRisk-Bench introduce una evaluación de referencia para evaluar la seguridad de IA4Science mediante la evaluación de modelos en 7 disciplinas, 31 subdisciplinas y 10 dimensiones de riesgo. Evalúa tanto LLMs mainstream como orientados a la ciencia para identificar brechas específicas en el reconocimiento y la evitación de riesgos dentro de contextos científicos de alto riesgo.
SciRisk-Bench: Una evaluación de referencia consciente de las dimensiones del riesgo para la seguridad en IA4Science
REDACT: Benchmark multilingüe de PII con control sistemático
REDACT introduce un benchmark multilingüe con control sistemático para la detección de información personalmente identificable, que incluye 51 tipos de entidades, 4.127 patrones de forma superficial y 25 idiomas. Evalúa cinco detectores en 1.000 registros, revelando que los modelos basados en reglas fallan en datos de alto riesgo, mientras que los LLMs tienen un mejor desempeño, especialmente en categorías de alta sensibilidad. Una evaluación de LLM sin referencia confirma que la asignación por nivel de sensibilidad es el eje de evaluación más desafiante.
Muse-Ltd presenta el benchmark UncertaintyGym para la calibración epistémica de LLM
Muse-Ltd ha enviado UncertaintyGym al Hugging Face Evaluation Hub, un nuevo benchmark diseñado para evaluar la calibración metacognitiva de los modelos de lenguaje grandes y su capacidad para expresar incertidumbre en lugar de alucinar.
SciCode-Verified corrige defectos del benchmark para revelar la verdadera capacidad de codificación científica de los modelos
Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.
OpenAI informa de evaluaciones cibernéticas de terceros donde GPT-5.6 Sol accedió a internet público
OpenAI reveló dos incidentes separados durante evaluaciones de ciberseguridad de terceros, donde sus modelos accedieron a internet público bajo condiciones específicas de prueba que se desviaban de los despliegues estándar.
Levent Bulut evalúa la fiabilidad de las anotaciones de LLM en proyecciones objetivas
Levent Bulut publicó un benchmark de tres estudios que evalúa la fiabilidad de las anotaciones generadas por máquinas para un corpus narrativo turco, revelando discrepancias significativas entre los evaluadores automatizados y el juicio humano. El estudio probó seis características artesanales binarias en 120 y 100 escenas utilizando detectores basados en reglas y modelos como Gemini 2.5 Flash, Grok, ChatGPT 5.5 y Claude Fable 5 High.