Sujet · Benchmark results
media AI News (smol.ai) · il y a 10 j Terminal-Bench 2 · 67.4% · 21 vues

Alibaba annonce Qwen3.8-Max avec 2,4T de paramètres et des poids ouverts à venir

Alibaba a annoncé Qwen3.8-Max comme son nouveau modèle phare, le décrivant comme une architecture sparse de 2,4T de paramètres axée sur les travaux agents à long terme, la programmation et le raisonnement multimodal. L'entreprise a confirmé que les poids ouverts pour Qwen3.8-Max seront publiés la semaine prochaine, accompagnés de la variante à poids ouverts Qwen3.8-27B.

media Together AI Blog · il y a 21 j · 8 vues

Kimi K3 égale Claude Fable 5 sur la qualité DeepSWE pour un tiers du coût

Kimi K3, un modèle à poids ouverts de Moonshot AI, atteint des performances comparables à celles de Claude Fable 5 d'Anthropic sur le benchmark DeepSWE tout en coûtant nettement moins par tâche. Lors d'une évaluation du 16 juillet 2026, Kimi K3 a obtenu un taux de réussite pass@1 de 68,5 % contre 69,9 % pour Fable 5, mais l'a surpassé dans les scénarios à multiples tentatives et a offert une efficacité coûts supérieure.

arxiv τ²-bench (tau2-bench) · il y a 23 j · 3 vues

τ-bench 1.0.1 corrige la notation de banking_knowledge pour éviter de pénaliser le comportement prudent des agents

Sierra Research a publié τ-bench 1.0.1, qui corrige le schéma de notation de la tâche `banking_knowledge` afin d'arrêter de pénaliser les agents pour leurs vérifications prudentes et résout plusieurs incohérences de données. La mise à jour garantit que le re-notage des trajectoires du classement augmente uniquement les scores, sans qu'aucune simulation précédemment validée ne soit défaillante.

media Latent Space · il y a 29 j · 3 vues

Moonshot AI lance Kimi K3, un modèle de pointe ouvert à 2,8 T de paramètres

Moonshot AI a présenté Kimi K3, un nouveau modèle open-weights de classe frontière comportant 2,8 billions de paramètres au total et des capacités natives d'entrée multimodale. Officiellement positionné comme « Intelligence Frontière Ouverte », le modèle prend en charge une fenêtre de contexte de 1 million de tokens et utilise des composants architecturaux novateurs tels que l'attention Kimi Delta (KDA) et les résidus d'attention pour améliorer l'efficacité.

arxiv arXiv cs.AI · il y a 2 j HealthBench · 51.9% · 4 vues

Le RAG clinique VITA égale ou surpasse les grands modèles de langage de pointe sur HealthBench

Un système de génération augmentée par récupération conçu spécifiquement, nommé VITA, destiné aux contextes à revenu faible et intermédiaire, a été évalué face à des grands modèles de langage à usage général sur le benchmark HealthBench. L'étude démontre qu'une conception spécifique au corpus peut maintenir des performances compétitives même lorsque de nouveaux modèles de pointe sont publiés.