| 2026-09-10 |
DeepSeek-V4.1-Flash |
74.2% |
DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo
|
| 2026-09-04 |
GPT-6 Astra |
74.1% |
OpenAI lança GPT-6 Astra, um modelo de uso computacional com contexto de 1,05M
|
| 2026-09-04 |
Muse Spark 1.3 |
75.4% |
Meta lança Muse Spark 1.3 com menos chamadas de ferramentas e tokens
|
| 2026-08-26 |
GLM-5.3-Flash |
63.0% |
Ox Alpha é o GLM-5.3-Flash
|
| 2026-08-22 |
GLM-5.3 |
69.0% |
GLM-5.3 iguala a precisão do Claude Fable 5 no DeepSWE por um quinto do custo
|
| 2026-08-22 |
Claude Fable 5 |
69.7% |
GLM-5.3 iguala a precisão do Claude Fable 5 no DeepSWE por um quinto do custo
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
59.3% |
DeepSeek lança o modelo multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
Ornith-1.5 |
56.0% |
Z.ai propõe lei de escala pós-treinamento e lança GLM 5.3; Ornith-1.5 inicia com autoaperfeiçoamento
|
| 2026-08-19 |
Ornith-1.5 |
56.0% |
Ornith-1.5 lança modelos de 9B, 35B-A3B e 397B com treinamento de autoaperfeiçoamento
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
62.8% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 no DeepSWE: Custo, Codificação e Roteamento
|
| 2026-08-18 |
Claude Fable 5 |
69.7% |
DeepSeek V4 Pro 0813 vs Claude Fable 5 no DeepSWE: Custo, Codificação e Roteamento
|
| 2026-08-18 |
GPT-5.6 Sol |
85.8% |
DeepSeek V4 Pro e GPT-5.6 Sol resolvem 83% das tarefas do DeepSWE por $3,35
|
| 2026-08-18 |
DeepSeek V4 Pro 0813 |
88.5% |
DeepSeek V4 Pro e GPT-5.6 Sol resolvem 83% das tarefas do DeepSWE por $3,35
|
| 2026-08-17 |
GLM-5.3 |
66.9% |
Z.ai lança modelo de codificação GLM-5.3; Cursor se junta à SpaceXAI
|
| 2026-08-13 |
Gemini 3.7 Flash |
65.3% |
Google apresenta o Gemini 3.7 Flash com melhorias em codificação e menor custo
|
| 2026-08-13 |
DeepSeek-V4-Pro |
62.7% |
Lançamento GA do DeepSeek-V4-Pro melhora capacidades de agente e adiciona suporte à API de Respostas
|
| 2026-08-13 |
Grok 4.6 |
65.9% |
SpaceXAI lança Grok 4.6 com contexto de 500K e raciocínio agêntico aprimorado
|
| 2026-08-07 |
DeepSeek-V4 Flash 0731 |
53.3% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna no DeepSWE: Custo e Codificação
|
| 2026-08-07 |
GPT-5.6 Luna |
67.2% |
DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna no DeepSWE: Custo e Codificação
|
| 2026-08-03 |
Qwen3.8-Max |
56.6% |
Alibaba lança Qwen3.8-Max, um modelo MoE de 2,4T parâmetros
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
54.4% |
DeepSeek lança V4-Flash-0731 com grandes ganhos agênticos e menor custo
|
| 2026-07-31 |
DeepSeek-V4-Flash |
54.4% |
DeepSeek lança o DeepSeek-V4-Flash em beta público com capacidades aprimoradas de agente
|
| 2026-07-27 |
Gemini 3.6 Flash |
49.0% |
Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber
|
| 2026-07-27 |
Kimi K3 |
68.5% |
Kimi K3 supera GPT-5.6 Sol no DeepSWE pass@4 e custa 64% menos
|
| 2026-07-27 |
GPT-5.6 Sol |
72.7% |
Kimi K3 supera GPT-5.6 Sol no DeepSWE pass@4 e custa 64% menos
|