| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.6% |
DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo
|
| 2026-09-07 |
K2-Horizon-MoVA-36B-A4B |
58.6% |
IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
66.9% |
IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
|
| 2026-09-04 |
Muse Spark 1.3 |
88.8% |
Meta lança Muse Spark 1.3 com menos chamadas de ferramentas e tokens
|
| 2026-08-26 |
Granite 4.2 30B |
29.24% |
IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
|
| 2026-08-26 |
Granite 4.2 8B |
20.56% |
IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
|
| 2026-08-21 |
Grok 4.6 |
88.4% |
SpaceXAI apresenta Grok 4.6 com dados do Cursor para trabalho agêntico
|
| 2026-08-21 |
DeepSeek-V4-Flash-Vision-Exp |
83.9% |
DeepSeek lança o modelo multimodal DeepSeek-V4-Flash-Vision-Exp
|
| 2026-08-20 |
agents |
94.0% |
Meta lança Muse Video com áudio nativo; Stripe adquire OpenRouter
|
| 2026-08-19 |
Ornith-1.5 |
86.1% |
Ornith-1.5 lança modelos de 9B, 35B-A3B e 397B com treinamento de autoaperfeiçoamento
|
| 2026-08-13 |
DeepSeek-V4-Pro |
87.9% |
Lançamento GA do DeepSeek-V4-Pro melhora capacidades de agente e adiciona suporte à API de Respostas
|
| 2026-08-13 |
Grok 4.6 |
88.4% |
xAI lança Grok 4.6; Alibaba abre Qwen3.8-MoE; DeepSeek V4 Pro GA
|
| 2026-08-11 |
Opus 5 |
86.74% |
Agente auto-desenvolvedor Ouroboros estabelece novos recordes com Opus 5
|
| 2026-08-10 |
Qwen3.6-27B |
60.7% |
Meta lança Muse Glimmer, um modelo agêntico de pesos abertos com 30B que roda em uma GPU de consumo
|
| 2026-08-09 |
DeepSeek V4 Flash 0731 |
82.7% |
DeepSeek V4 Flash 0731 atinge 82,7% no Terminal-Bench 2.1 em ambiente público
|
| 2026-08-08 |
Pokee-Isaac 28B |
65.1% |
Pokee AI lança Pokee-Isaac 28B, um modelo de contexto de 10M de tokens para implantação em limites definidos
|
| 2026-08-07 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek lança V4-Flash-0731, superando o V4-Pro a um custo menor
|
| 2026-08-05 |
Muse Spark 1.1 |
80.0% |
Meta lança agente de terminal beta do Muse Code alimentado pelo Muse Spark 1.2
|
| 2026-08-05 |
Qwen3.8-Max |
67.4% |
Alibaba anuncia Qwen3.8-Max com 2,4T de parâmetros e pesos abertos em breve
|
| 2026-08-03 |
Qwen3.8-Max |
86.6% |
Alibaba lança Qwen3.8-Max, um modelo MoE de 2,4T parâmetros
|
| 2026-08-03 |
Inkling-Small |
64.7% |
Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
|
| 2026-08-01 |
V4 Flash 0731 |
79.0% |
DeepSeek lança V4-Flash com ganhos significativos no pós-treinamento e pesos abertos
|
| 2026-08-01 |
DeepSeek-V4-Flash |
79.0% |
DeepSeek lança V4-Flash com ganhos pós-treinamento e pesos abertos
|
| 2026-07-31 |
DeepSeek-V4-Flash-0731 |
82.7% |
DeepSeek lança V4-Flash-0731 com grandes ganhos agênticos e menor custo
|
| 2026-07-31 |
DeepSeek-V4-Flash |
82.7% |
DeepSeek lança o DeepSeek-V4-Flash em beta público com capacidades aprimoradas de agente
|
| 2026-07-27 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber
|
| 2026-07-26 |
KAT-Coder-V2.5 |
60.7% |
KwaiKAT lança KAT-Coder-V2.5, um modelo de codificação agêntica treinado em mais de 100.000 ambientes verificáveis
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber para cargas de trabalho agênticas
|
| 2026-07-21 |
Gemini 3.5 Flash-Lite |
54.0% |
Google lança Gemini 3.6 Flash, 3.5 Flash-Lite e 3.5 Flash Cyber
|
| 2026-07-08 |
hermes |
55.0% |
Usuários comparam Mimo v2.5 contra DeepSeek V4 Flash e Hermes
|
| 2026-07-08 |
Grok 4.5 |
83.3% |
xAI lança Grok 4.5 com baixo custo e desempenho misto em benchmarks
|
| 2026-07-07 |
LLM-as-a-Verifier |
86.5% |
LLM-as-a-Verifier apresenta framework de verificação de propósito geral com pontuação contínua
|
| 2026-07-05 |
GLM 5.2 FP8 with FP8 KV |
79.8% |
GLM 5.2 FP8 com KV FP8 atinge 79,8% no Terminal-Bench 2.1
|
| 2026-04-25 |
Qwen3.6-27B |
59.3% |
Alibaba lança Qwen3.6-27B, superando predecessor maior em benchmarks de codificação
|
| 2026-04-25 |
GPT-5.5 |
82.7% |
OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lança GPT-5.5 com capacidades agênticas e preço de API dobrado
|
| 2026-04-23 |
GPT-5.5 |
82.7% |
OpenAI lança GPT-5.5 e GPT-5.5 Pro na API
|
| 2026-04-12 |
MiniMax M2.7 |
57.0% |
MiniMax abre o código-fonte do M2.7, um modelo MoE autoevolutivo que pontua 56.22% no SWE-Pro
|
| 2026-02-10 |
Step 3.5 Flash |
51.0% |
Passo 3.5 Flash: modelo MoE aberto com 11B ativos atinge desempenho de agente de nível fronteira
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
58.1% |
OpenAI torna o GPT-5.1-Codex-Max o padrão no Codex CLI
|