Resultados de DeepSeek V4 Flash 0731 en ARC-AGI
El artículo presenta los resultados del benchmark ARC-AGI para el modelo DeepSeek V4 Flash 0731. Enlaza a la página oficial de resultados alojada por la organización ARC Prize.
El artículo presenta los resultados del benchmark ARC-AGI para el modelo DeepSeek V4 Flash 0731. Enlaza a la página oficial de resultados alojada por la organización ARC Prize.
DeepSeek ha lanzado DeepSeek-V4-Flash-0731, una versión actualizada de su modelo "Flash" más pequeño que supera al mayor DeepSeek-V4-Pro en benchmarks independientes. El lanzamiento utiliza un nuevo proceso de ajuste fino mientras mantiene la arquitectura original de Mezcla de Expertos con 284 mil millones de parámetros en total.
Una comparación de DeepSeek-V4 Flash 0731 y GPT-5.6 Luna en el benchmark DeepSWE revela que, aunque GPT-5.6 Luna es el ingeniero más fuerte, una estrategia en cascada que utiliza ambos modelos logra mayor precisión a menor costo.
Artificial Analysis ha actualizado su índice agéntico para clasificar a Qwen 3.8 Max como el mejor modelo general, colocándolo por encima de Opus 5.
Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.
Alibaba ha anunciado Qwen3.8-Max como su nuevo modelo insignia, describiéndolo como una arquitectura dispersa de 2.4T parámetros centrada en trabajo agénico de largo alcance, codificación y razonamiento multimodal. La compañía confirmó que los pesos abiertos para Qwen3.8-Max se lanzarán la próxima semana junto con la variante de pesos abiertos Qwen3.8-27B.
Qwen 3.8 Max alcanza una puntuación de 1588 en el Debate Benchmark, superando la puntuación de 1462 de Qwen 3.7 Max. Este benchmark evalúa qué tan bien los grandes modelos de lenguaje sostienen un argumento bajo oposición adversarial y multironda en diversos temas.
Una evaluación interna de modelos de peso abierto en tareas agénticas difíciles encontró que DeepSeek v4 flash era la opción más rápida y económica entre sus pares. La prueba involucró flujos de trabajo de larga duración en múltiples aplicaciones, evaluados mediante comprobaciones deterministas que requerían éxito total.
Qwen3.8-Max (2.4T) es un nuevo modelo de pesos abiertos que tiene un rendimiento muy cercano al de Kimi K3 y DeepSeek V4 Flash en todas las categorías de benchmarks, mientras demuestra un desempeño superior en tareas de codificación y software.
Se ha lanzado Qwen 3.8-Max y actualmente ocupa la posición #2 en el ranking de Vision Arena, solo por detrás de Claude Fable 5 Max.
El artículo anuncia que el modelo DeepSeek-V4-Flash-0731 ha superado a Fable-5, Sol y Kimi-K3 en un benchmark de ajedrez.
Levent Bulut publicó un benchmark de tres estudios que evalúa la fiabilidad de las anotaciones generadas por máquinas para un corpus narrativo turco, revelando discrepancias significativas entre los evaluadores automatizados y el juicio humano. El estudio probó seis características artesanales binarias en 120 y 100 escenas utilizando detectores basados en reglas y modelos como Gemini 2.5 Flash, Grok, ChatGPT 5.5 y Claude Fable 5 High.
El modelo DeepSeek-V4-Flash-0731 ha alcanzado una puntuación de índice de inteligencia de 50, una métrica que iguala el rendimiento de los principales modelos avanzados de marzo de 2026, que tenían una puntuación de 51.
Un meme traducido que circula en Reddit indica que un competidor tuvo que reducir sus precios en un 80% debido a la presión competitiva de DeepSeek v4 flash. Este modelo de pesos abiertos cuenta con 284 mil millones de parámetros totales y 13 mil millones de parámetros activos, ofreciendo métricas superiores de relación precio-rendimiento.
DeepSeek afirma que su nuevo modelo de disponibilidad general, DeepSeek V4 Flash, alcanza una paridad de rendimiento con Anthropic's Sonnet 5 y xAI's Grok 4.5 en la prueba DeepSWE.
El modelo DeepSeek-V4-Flash-0731 ahora supera significativamente a DeepSeek-V4-Pro-Preview en varias pruebas de benchmark.
El nuevo modelo DeepSeek V4-Flash ha logrado una puntuación de 50 en el Índice de ArtificialAnalysis. Este resultado lo sitúa a solo un punto por debajo de GLM-5.2 y GPT-5.6 Luna.
El modelo DeepSeek-V4-Flash-0731 supera a GLM 5.2 manteniendo el mismo precio que su predecesor.
DeepSeek ha actualizado su modelo V4 Flash, lanzando una nueva versión el 2026-07-31 que muestra ganancias significativas de rendimiento sobre la vista previa anterior. La actualización introduce resultados para varios nuevos benchmarks mientras mejora las puntuaciones en los existentes.
Un usuario evaluó Kimi K3 frente a Claude Opus 4.8 ejecutando 34 prompts de un solo ejemplo y evaluando el HTML, capturas de pantalla y GIF resultantes utilizando Sonnet 4.6. La evaluación concluyó que Kimi K3 produjo mejores resultados que Opus 4.8.