Résultats de DeepSeek V4 Flash 0731 sur ARC-AGI
L'article présente les résultats du benchmark ARC-AGI pour le modèle DeepSeek V4 Flash 0731. Il renvoie à la page officielle des résultats hébergée par l'organisation ARC Prize.
L'article présente les résultats du benchmark ARC-AGI pour le modèle DeepSeek V4 Flash 0731. Il renvoie à la page officielle des résultats hébergée par l'organisation ARC Prize.
DeepSeek a publié DeepSeek-V4-Flash-0731, une version mise à jour de son modèle « Flash » plus petit qui surpasse le plus grand DeepSeek-V4-Pro sur des benchmarks indépendants. Cette publication utilise un nouveau processus de réglage fin tout en conservant l'architecture originale Mixture-of-Experts avec 284 milliards de paramètres au total.
Une comparaison entre DeepSeek-V4 Flash 0731 et GPT-5.6 Luna sur le benchmark DeepSWE révèle que, bien que GPT-5.6 Luna soit l'ingénieur le plus performant, une stratégie en cascade utilisant les deux modèles atteint une précision supérieure à un coût moindre.
Artificial Analysis a mis à jour son indice agentic pour classer Qwen 3.8 Max comme le meilleur modèle global, le plaçant devant Opus 5.
Les auteurs identifient que les scores en plateau sur le benchmark SciCode proviennent de défauts significatifs dans l'instrument d'évaluation plutôt que de limitations dans la capacité des modèles. Un audit par des experts du domaine de 65 problèmes de test a révélé 263 défauts, dont 192 entraînant le rejet incorrect de solutions correctes en raison de problèmes tels que des réponses de référence non reproductibles et des tolérances excessivement serrées.
Alibaba a annoncé Qwen3.8-Max comme son nouveau modèle phare, le décrivant comme une architecture sparse de 2,4T de paramètres axée sur les travaux agents à long terme, la programmation et le raisonnement multimodal. L'entreprise a confirmé que les poids ouverts pour Qwen3.8-Max seront publiés la semaine prochaine, accompagnés de la variante à poids ouverts Qwen3.8-27B.
Qwen 3.8 Max atteint un score de 1588 au Debate Benchmark, améliorant le score de 1462 de Qwen 3.7 Max. Ce benchmark évalue la capacité des grands modèles de langage à soutenir un argument face à une opposition adversariale et multiround sur divers sujets.
Une évaluation interne des modèles à poids ouvert sur des tâches agentic complexes a révélé que DeepSeek v4 flash était l'option la plus rapide et la moins chère parmi ses pairs. Le test impliquait des workflows de longue durée sur plusieurs applications, évalués par des vérifications déterministes exigeant un succès complet.
Qwen3.8-Max (2.4T) est un nouveau modèle à poids ouverts qui offre des performances très proches de celles de Kimi K3 et DeepSeek V4 Flash dans toutes les catégories de benchmarks, tout en démontrant une performance supérieure dans les tâches de codage et de logiciel.
Qwen 3.8-Max a été publié et occupe actuellement la position #2 dans le classement de Vision Arena, derrière seulement Claude Fable 5 Max.
L'article annonce que le modèle DeepSeek-V4-Flash-0731 a dépassé Fable-5, Sol et Kimi-K3 sur un benchmark d'échecs.
Levent Bulut a publié un benchmark composé de trois études évaluant la fiabilité des annotations générées par machine pour un corpus narratif turc, révélant d'importantes divergences entre les évaluateurs automatisés et le jugement humain. L'étude a testé six caractéristiques binaires sur 120 et 100 scènes en utilisant des détecteurs basés sur des règles et des modèles incluant Gemini 2.5 Flash, Grok, ChatGPT 5.5 et Claude Fable 5 High.
Le modèle DeepSeek-V4-Flash-0731 a atteint un score d'indice d'intelligence de 50, une métrique qui égale la performance des modèles de pointe de mars 2026, qui avaient un score de 51.
Un meme traduit circulant sur Reddit indique qu'un concurrent a dû réduire ses prix de 80% en raison de la pression concurrentielle de DeepSeek v4 flash. Ce modèle à poids ouverts dispose de 284 milliards de paramètres totaux et de 13 milliards de paramètres actifs, offrant des métriques supérieures de rapport qualité-prix.
DeepSeek affirme que son nouveau modèle généralement disponible, DeepSeek V4 Flash, atteint une parité de performance avec Anthropic's Sonnet 5 et xAI's Grok 4.5 sur le benchmark DeepSWE.
Le modèle DeepSeek-V4-Flash-0731 surpasse désormais significativement DeepSeek-V4-Pro-Preview dans divers tests de benchmark.
Le nouveau modèle DeepSeek V4-Flash a obtenu un score de 50 à l'indice ArtificialAnalysis. Ce résultat le place à seulement un point en dessous de GLM-5.2 et GPT-5.6 Luna.
Le modèle DeepSeek-V4-Flash-0731 surpasse GLM 5.2 tout en maintenant le même prix que son prédécesseur.
DeepSeek a mis à jour son modèle V4 Flash, en publiant une nouvelle version le 2026-07-31 qui affiche des gains de performance significatifs par rapport à la précédente version d'aperçu. La mise à jour introduit des résultats pour plusieurs nouveaux benchmarks tout en améliorant les scores sur ceux existants.
Un utilisateur a évalué Kimi K3 par rapport à Claude Opus 4.8 en exécutant 34 prompts en un seul exemple et en évaluant le HTML, les captures d'écran et les GIF résultants à l'aide de Sonnet 4.6. L'évaluation a conclu que Kimi K3 a produit de meilleurs résultats qu'Opus 4.8.