El nuevo modelo DeepSeek V4-Flash ha logrado una puntuación de 50 en el Índice de ArtificialAnalysis. Este resultado lo sitúa a solo un punto por debajo de GLM-5.2 y GPT-5.6 Luna.
DeepSeek V4-Flash alcanza 50 en el Índice de ArtificialAnalysis
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| Artificial Analysis Intelligence Index | DeepSeek V4-Flash | 50% |
Kimi K3, DeepSeek V4 Pro y GLM-5.2 comparados en benchmarks, licencia y costo de servicio
Una comparación de tres modelos Mixture-of-Experts de pesos abiertos—Kimi K3 de Moonshot AI, DeepSeek V4 Pro y GLM-5.2 de Zhipu AI—evalúa sus capacidades, términos de licencia y costos de servicio para cargas de trabajo de codificación y agentes a largo plazo.
Charlie O'Neill de Base-10 argumenta que Kimi y GLM son mejores que Opus 5
Charlie O'Neill de Base-10 discute por qué los modelos Kimi y GLM son "casi objetivamente" superiores a Opus 5 en un episodio reciente con Dwarkesh Patel.
DeepSeek V4.1 Flash encabeza el Índice de Inteligencia Artificial Analysis v4.3
DeepSeek V4.1 Flash ha tomado el primer lugar en la nueva benchmark Astra dentro de la actualización del Índice de Inteligencia Artificial Analysis v4.3.
LiveBench añade DeepSeek v4.1 Flash
La plataforma de benchmarking LiveBench ha añadido el modelo DeepSeek v4.1 Flash a su suite de evaluación.
La destilación de GLM-5.3 Flash intercambia consistencia por una reducción de costo de 17x
Una comparación de GLM-5.3 y su variante destilada, GLM-5.3 Flash, en el benchmark DeepSWE revela que la destilación preserva la capacidad central de codificación mientras reduce significativamente los costos de rollout. El modelo completo logra una tasa de pass@1 del 69.0% a $3.99 por tarea, mientras que la variante Flash obtiene un puntaje de 63.4% a solo $0.24, lo que representa una reducción de precio de 17x.