Benchmark results
arxiv arXiv cs.AI · il y a 3 j

SciCode-Verified corrige les défauts du benchmark pour révéler la véritable capacité de codage scientifique des modèles

Les auteurs identifient que les scores en plateau sur le benchmark SciCode proviennent de défauts significatifs dans l'instrument d'évaluation plutôt que de limitations dans la capacité des modèles. Un audit par des experts du domaine de 65 problèmes de test a révélé 263 défauts, dont 192 entraînant le rejet incorrect de solutions correctes en raison de problèmes tels que des réponses de référence non reproductibles et des tolérances excessivement serrées.

media AI News (smol.ai) · il y a 4 j Terminal-Bench 2 · 67.4% · 8 vues

Alibaba annonce Qwen3.8-Max avec 2,4T de paramètres et des poids ouverts à venir

Alibaba a annoncé Qwen3.8-Max comme son nouveau modèle phare, le décrivant comme une architecture sparse de 2,4T de paramètres axée sur les travaux agents à long terme, la programmation et le raisonnement multimodal. L'entreprise a confirmé que les poids ouverts pour Qwen3.8-Max seront publiés la semaine prochaine, accompagnés de la variante à poids ouverts Qwen3.8-27B.

media Hugging Face Forums · il y a 7 j · 8 vues

Levent Bulut évalue la fiabilité de l'annotation des LLM sur la projection objective

Levent Bulut a publié un benchmark composé de trois études évaluant la fiabilité des annotations générées par machine pour un corpus narratif turc, révélant d'importantes divergences entre les évaluateurs automatisés et le jugement humain. L'étude a testé six caractéristiques binaires sur 120 et 100 scènes en utilisant des détecteurs basés sur des règles et des modèles incluant Gemini 2.5 Flash, Grok, ChatGPT 5.5 et Claude Fable 5 High.