Le nouveau modèle DeepSeek V4-Flash a obtenu un score de 50 à l'indice ArtificialAnalysis. Ce résultat le place à seulement un point en dessous de GLM-5.2 et GPT-5.6 Luna.
DeepSeek V4-Flash atteint 50 à l'indice ArtificialAnalysis
Benchmarks
| Benchmark | Modèle | Score |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
Kimi K3, DeepSeek V4 Pro et GLM-5.2 comparés sur les benchmarks, la licence et le coût de déploiement
Une comparaison de trois modèles Mixture-of-Experts à poids ouverts — Kimi K3 de Moonshot AI, DeepSeek V4 Pro et GLM-5.2 de Zhipu AI — évalue leurs capacités, leurs conditions de licence et leurs coûts de déploiement pour les charges de travail de codage et d'agents sur le long terme.
Charlie O'Neill de Base-10 affirme que Kimi et GLM sont meilleurs qu'Opus 5
Charlie O'Neill de Base-10 discute pourquoi les modèles Kimi et GLM sont "presque objectivement" supérieurs à Opus 5 dans un épisode récent avec Dwarkesh Patel.
DeepSeek V4.1 Flash en tête de l'Indice d'Intelligence Artificial Analysis v4.3
DeepSeek V4.1 Flash a pris la première place sur le nouveau benchmark Astra dans la mise à jour de l'Indice d'Intelligence Artificial Analysis v4.3.
LiveBench ajoute DeepSeek v4.1 Flash
La plateforme de benchmarking LiveBench a ajouté le modèle DeepSeek v4.1 Flash à sa suite d'évaluation.
La distillation GLM-5.3 Flash échange la cohérence contre une réduction des coûts de 17x
Une comparaison entre GLM-5.3 et sa variante distillée, GLM-5.3 Flash, sur le benchmark DeepSWE révèle que la distillation préserve les capacités fondamentales de codage tout en réduisant significativement les coûts de rollout. Le modèle complet atteint un taux pass@1 de 69,0 % à 3,99 $ par tâche, tandis que la variante Flash obtient 63,4 % pour seulement 0,24 $, représentant une réduction de prix de 17x.