Benchmark results
arxiv arXiv cs.AI · há 3 d

SciCode-Verified corrige defeitos de benchmark para revelar a verdadeira capacidade de codificação científica dos modelos

Os autores identificam que a estagnação das pontuações no benchmark SciCode decorre de defeitos significativos no instrumento de avaliação, e não de limitações na capacidade dos modelos. Uma auditoria realizada por especialistas de domínio em 65 problemas de teste revelou 263 defeitos, dos quais 192 causavam a rejeição incorreta de soluções corretas devido a problemas como respostas padrão não reproduzíveis e tolerâncias excessivamente restritivas.

media AI News (smol.ai) · há 4 d Terminal-Bench 2 · 67.4% · 8 visualizações

Alibaba anuncia Qwen3.8-Max com 2,4T de parâmetros e pesos abertos em breve

A Alibaba anunciou o Qwen3.8-Max como seu novo modelo principal, descrevendo-o como uma arquitetura esparsa de 2,4T de parâmetros focada em trabalho agêntico de longo prazo, codificação e raciocínio multimodal. A empresa confirmou que os pesos abertos do Qwen3.8-Max serão lançados na próxima semana junto à variante de pesos abertos Qwen3.8-27B.

media Hugging Face Forums · há 7 d · 8 visualizações

Levent Bulut avalia a confiabilidade da anotação de LLMs em projeção objetiva

Levent Bulut publicou um benchmark com três estudos avaliando a confiabilidade das anotações geradas por máquinas para um corpus narrativo turco, revelando discrepâncias significativas entre os classificadores automatizados e o julgamento humano. O estudo testou seis características de ofício binárias em 120 e 100 cenas usando detectores baseados em regras e modelos incluindo Gemini 2.5 Flash, Grok, ChatGPT 5.5 e Claude Fable 5 High.