Resultados do DeepSeek V4 Flash 0731 no ARC-AGI
O artigo apresenta os resultados do benchmark ARC-AGI para o modelo DeepSeek V4 Flash 0731. Ele vincula à página oficial de resultados hospedada pela organização ARC Prize.
O artigo apresenta os resultados do benchmark ARC-AGI para o modelo DeepSeek V4 Flash 0731. Ele vincula à página oficial de resultados hospedada pela organização ARC Prize.
A DeepSeek lançou o DeepSeek-V4-Flash-0731, uma versão atualizada de seu modelo "Flash" menor que supera o maior DeepSeek-V4-Pro em benchmarks independentes. O lançamento utiliza um novo processo de ajuste fino enquanto mantém a arquitetura original Mixture-of-Experts com 284 bilhões de parâmetros no total.
Uma comparação entre DeepSeek-V4 Flash 0731 e GPT-5.6 Luna no benchmark DeepSWE revela que, embora GPT-5.6 Luna seja o engenheiro mais forte, uma estratégia em cascata usando ambos os modelos alcança maior precisão a um custo menor.
A Artificial Analysis atualizou seu índice agêntico para classificar o Qwen 3.8 Max como o melhor modelo geral, colocando-o à frente do Opus 5.
Os autores identificam que a estagnação das pontuações no benchmark SciCode decorre de defeitos significativos no instrumento de avaliação, e não de limitações na capacidade dos modelos. Uma auditoria realizada por especialistas de domínio em 65 problemas de teste revelou 263 defeitos, dos quais 192 causavam a rejeição incorreta de soluções corretas devido a problemas como respostas padrão não reproduzíveis e tolerâncias excessivamente restritivas.
A Alibaba anunciou o Qwen3.8-Max como seu novo modelo principal, descrevendo-o como uma arquitetura esparsa de 2,4T de parâmetros focada em trabalho agêntico de longo prazo, codificação e raciocínio multimodal. A empresa confirmou que os pesos abertos do Qwen3.8-Max serão lançados na próxima semana junto à variante de pesos abertos Qwen3.8-27B.
O Qwen 3.8 Max alcançou uma pontuação de 1588 no Debate Benchmark, superando a pontuação de 1462 do Qwen 3.7 Max. Este benchmark avalia o quão bem os grandes modelos de linguagem sustentam um argumento sob oposição adversarial e multironda em vários tópicos.
Uma avaliação interna de modelos de peso aberto em tarefas agênticas difíceis encontrou o DeepSeek v4 flash como a opção mais rápida e barata entre seus pares. O teste envolveu fluxos de trabalho de longa duração em vários aplicativos, avaliados por verificações determinísticas que exigem sucesso total.
O Qwen3.8-Max (2.4T) é um novo modelo de pesos abertos que tem desempenho muito próximo ao do Kimi K3 e do DeepSeek V4 Flash em todas as categorias de benchmarks, enquanto demonstra desempenho superior em tarefas de codificação e software.
O Qwen 3.8-Max foi lançado e atualmente ocupa a posição #2 no ranking do Vision Arena, ficando atrás apenas do Claude Fable 5 Max.
O artigo anuncia que o modelo DeepSeek-V4-Flash-0731 superou Fable-5, Sol e Kimi-K3 em um benchmark de xadrez.
Levent Bulut publicou um benchmark com três estudos avaliando a confiabilidade das anotações geradas por máquinas para um corpus narrativo turco, revelando discrepâncias significativas entre os classificadores automatizados e o julgamento humano. O estudo testou seis características de ofício binárias em 120 e 100 cenas usando detectores baseados em regras e modelos incluindo Gemini 2.5 Flash, Grok, ChatGPT 5.5 e Claude Fable 5 High.
O modelo DeepSeek-V4-Flash-0731 atingiu uma pontuação de índice de inteligência de 50, uma métrica que iguala o desempenho dos principais modelos de fronteira de março de 2026, que tinham uma pontuação de 51.
Um meme traduzido circulando no Reddit indica que um concorrente teve que reduzir seus preços em 80% devido à pressão competitiva do DeepSeek v4 flash. Este modelo de pesos abertos possui 284 bilhões de parâmetros totais e 13 bilhões de parâmetros ativos, entregando métricas superiores de custo-benefício.
A DeepSeek afirma que seu novo modelo de disponibilidade geral, DeepSeek V4 Flash, atinge paridade de desempenho com Anthropic's Sonnet 5 e xAI's Grok 4.5 no benchmark DeepSWE.
O modelo DeepSeek-V4-Flash-0731 agora supera significativamente o DeepSeek-V4-Pro-Preview em vários testes de benchmark.
O novo modelo DeepSeek V4-Flash conseguiu uma pontuação de 50 no Índice ArtificialAnalysis. Esse resultado o coloca a apenas um ponto abaixo do GLM-5.2 e do GPT-5.6 Luna.
O modelo DeepSeek-V4-Flash-0731 supera o GLM 5.2 mantendo o mesmo preço de seu antecessor.
A DeepSeek atualizou seu modelo V4 Flash, lançando uma nova versão em 2026-07-31 que apresenta ganhos significativos de desempenho em relação à versão anterior. A atualização introduz resultados para vários novos benchmarks enquanto melhora as pontuações nos existentes.
Um usuário avaliou o Kimi K3 em comparação ao Claude Opus 4.8, executando 34 prompts de um único exemplo e avaliando o HTML, capturas de tela e GIFs resultantes usando o Sonnet 4.6. A avaliação concluiu que o Kimi K3 produziu resultados melhores do que o Opus 4.8.