ForecastBench-Sim es un benchmark de pronóstico en mundo simulado que utiliza ejecuciones del juego Freeciv. Permite pronósticos continuos o binarios en horizontes arbitrarios, con mundos de intervención para preguntas causales y resultados raros, y proporciona retroalimentación inmediata y resoluble para evaluar el razonamiento probabilístico en entornos dinámicos.
ForecastBench-Sim: Benchmark de pronóstico en mundo simulado
QMFOL: Evaluación del razonamiento de LLM con complejidad lógica controlable
QMFOL es un marco automatizado que genera tareas de razonamiento en lógica de primer orden monádica con complejidad cuantificable. Produce 2880 instancias de evaluación en 960 configuraciones, evaluando seis modelos grandes de razonamiento y dos LLMs, mostrando degradación del rendimiento y aumento del costo computacional a medida que la complejidad lógica aumenta.
CombEval: Benchmark para el conteo combinatorio en LLMs
CombEval es un benchmark dinámico que genera problemas de conteo en lenguaje natural con respuestas verificadas usando especificaciones Cofola tipadas. Evalúa 11 modelos de lenguaje grandes y revela fallos persistentes al manejar objetos ordenados, elementos indistinguibles, restricciones posicionales y dependencias anidadas, con errores arraigados en la interpretación de restricciones y principios de conteo.
VibeThinker-3B: ¿Qué es esta brujería?
VibeThinker-3B es un modelo pequeño de 3 mil millones de parámetros que se desempeña excepcionalmente bien en la prueba MathQA, obteniendo resultados comparables a los de modelos con alrededor de 30 mil millones de parámetros. El sólido rendimiento del modelo ha generado debate sobre su eficiencia y capacidades en el razonamiento matemático.
NVIDIA AVO alcanza el 100% en ARC-AGI-3
El modelo NVIDIA AVO ha obtenido una puntuación perfecta en la prueba ARC-AGI-3. Completó con éxito los 183 niveles en 25 entornos públicos sin instrucciones, reglas explícitas ni objetivos declarados.
Artificial Analysis descubre que los modelos de reconocimiento automático del habla reproducen transcripciones de benchmarks mediante pistas acústicas
La investigación de Artificial Analysis revela que varios modelos de código abierto de reconocimiento automático del habla (ASR) con alta puntuación optimizan para benchmarks reproduciendo las transcripciones de referencia incluso cuando el audio las contradice. El estudio evaluó 11 modelos ampliamente utilizados e identificó tres comportamientos específicos: reproducir texto de referencia erróneo, recuperar números silenciados y cambiar variantes ortográficas para ajustarse a las convenciones del benchmark.