O novo modelo DeepSeek V4-Flash conseguiu uma pontuação de 50 no Índice ArtificialAnalysis. Esse resultado o coloca a apenas um ponto abaixo do GLM-5.2 e do GPT-5.6 Luna.
DeepSeek V4-Flash alcança 50 no Índice ArtificialAnalysis
Benchmarks
| Benchmark | Modelo | Pontuação |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
Kimi K3, DeepSeek V4 Pro e GLM-5.2 comparados em benchmarks, licença e custo de serviço
Uma comparação entre três modelos esparsos Mixture-of-Experts de pesos abertos — Kimi K3 da Moonshot AI, DeepSeek V4 Pro e GLM-5.2 da Zhipu AI — avalia suas capacidades, termos de licenciamento e custos de serviço para cargas de trabalho de codificação e agentes em horizontes longos.
Charlie O'Neill da Base-10 argumenta que Kimi e GLM são melhores que Opus 5
Charlie O'Neill da Base-10 discute por que os modelos Kimi e GLM são "quase objetivamente" superiores ao Opus 5 em um episódio recente com Dwarkesh Patel.
DeepSeek V4.1 Flash lidera o Índice de Inteligência Artificial Analysis v4.3
DeepSeek V4.1 Flash assumiu o primeiro lugar na nova benchmark Astra dentro da atualização do Índice de Inteligência Artificial Analysis v4.3.
LiveBench adiciona DeepSeek v4.1 Flash
A plataforma de benchmarking LiveBench adicionou o modelo DeepSeek v4.1 Flash ao seu conjunto de avaliação.
GLM-5.3 Flash distillation troca consistência por redução de custo de 17x
Uma comparação entre GLM-5.3 e sua variante destilada, GLM-5.3 Flash, no benchmark DeepSWE revela que a destilação preserva a capacidade central de codificação enquanto reduz significativamente os custos de rollout. O modelo completo alcança uma taxa pass@1 de 69,0% a $3,99 por tarefa, enquanto a variante Flash obtém 63,4% por apenas $0,24, representando uma redução de preço de 17x.