Benchmark results
arxiv arXiv cs.AI · hace 3 d

SciCode-Verified corrige defectos del benchmark para revelar la verdadera capacidad de codificación científica de los modelos

Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.

media AI News (smol.ai) · hace 4 d Terminal-Bench 2 · 67.4% · 8 vistas

Alibaba anuncia Qwen3.8-Max con 2.4T parámetros y pesos abiertos próximamente

Alibaba ha anunciado Qwen3.8-Max como su nuevo modelo insignia, describiéndolo como una arquitectura dispersa de 2.4T parámetros centrada en trabajo agénico de largo alcance, codificación y razonamiento multimodal. La compañía confirmó que los pesos abiertos para Qwen3.8-Max se lanzarán la próxima semana junto con la variante de pesos abiertos Qwen3.8-27B.

media Hugging Face Forums · hace 7 d · 8 vistas

Levent Bulut evalúa la fiabilidad de las anotaciones de LLM en proyecciones objetivas

Levent Bulut publicó un benchmark de tres estudios que evalúa la fiabilidad de las anotaciones generadas por máquinas para un corpus narrativo turco, revelando discrepancias significativas entre los evaluadores automatizados y el juicio humano. El estudio probó seis características artesanales binarias en 120 y 100 escenas utilizando detectores basados en reglas y modelos como Gemini 2.5 Flash, Grok, ChatGPT 5.5 y Claude Fable 5 High.