| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
Google Research lança RRSI para evitar overfitting em harness de agentes de IA
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
ISTA lança GGUFs GSQ-RCO para Qwen3.8-Flash-Next e compilação Coder com 50% de especialistas podados
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
ROFT melhora modelos agênticos ajustando-os em explicações autogeradas
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI lança Ember-1, um Kimi K3 pós-treinado com 40% menos tokens
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por reparo guiado por testes
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
|
| 2026-09-09 |
base Test agent |
57.3% |
ExecCritic usa RL específico por função para melhorar agentes de codificação por meio de reparo guiado por testes
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY permite que Qwen3-14B domine o AppWorld usando apenas RL de resultado
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
IBM lança Granite 4.2 com raciocínio nativo e RL agêntico para modelos empresariais abertos
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
Meta lança Muse Video com áudio nativo; Stripe adquire OpenRouter
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai propõe lei de escala pós-treinamento e lança GLM 5.3; Ornith-1.5 inicia com autoaperfeiçoamento
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
Ornith-1.5 lança modelos de 9B, 35B-A3B e 397B com treinamento de autoaperfeiçoamento
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
Agente Kozuchi resolve 374 instâncias do SWE-bench Verified usando Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
Meta lança Muse Glimmer, um modelo agêntico de pesos abertos com 30B que roda em uma GPU de consumo
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
Microsoft Research lança o framework Orchard para IA agente escalável
|
| 2026-08-03 |
Inkling-Small |
80.2% |
Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
Anthropic lança Claude Opus 5 com raciocínio padrão e ganhos em codificação agêntica
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
Kimi K3, DeepSeek V4 Pro e GLM-5.2 comparados em benchmarks, licença e custo de serviço
|
| 2026-07-17 |
Devstral 2 |
72.2% |
Mistral Vibe for Code lidera quatro agentes de codificação na tarefa de scaffold para PR
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
Mistral Vibe for Code lidera quatro agentes de codificação na tarefa de scaffold para PR
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
UMoE realinha pools de especialistas MoE para ajuste fino específico de domínio aprimorado
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
UMoE realinha pools de especialistas MoE para ajuste fino específico de domínio aprimorado
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier apresenta framework de verificação de propósito geral com pontuação contínua
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
Alibaba lança Qwen3.6-27B, superando predecessor maior em benchmarks de codificação
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
DeepSeek lança V4 com arquitetura eficiente de contexto longo para agentes
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI anuncia a aposentadoria do o3 do ChatGPT e compartilha pontuações de benchmarks
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
Anthropic lança Claude Sonnet 4.6 com melhorias em codificação, uso de computador e contexto de 1M de tokens
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
Benchmarks descontaminados revelam lacuna de 12 pontos entre os principais modelos de codificação de IA
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B e DeepSeek V4 Flash lideram benchmarks de codificação local
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI lança GPT-5.2, superando Gemini 3 em benchmarks de codificação e raciocínio
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI apresenta GPT-5.2 com capacidades de ponta para trabalho profissional do conhecimento
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral lança modelos de codificação Devstral 2 e Mistral Vibe CLI
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral lança modelos de codificação Devstral 2 e Mistral Vibe CLI
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI torna o GPT-5.1-Codex-Max o padrão no Codex CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI lança Kimi K2 Thinking com uso de ferramentas agênticas
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI lança Kimi K2 Thinking, um modelo de raciocínio open-source com 1T parâmetros
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI lança API do GPT-5 com melhorias em codificação e agentes
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
Zhipu AI lança modelos GLM-4.5 que igualam Claude e DeepSeek
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
|
| 2025-07-28 |
Kimi K2 |
65.8% |
Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI lança Kimi-K2-Instruct, um modelo MoE de 1T parâmetros com capacidades agênticas
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI lança Kimi K2, um modelo MoE de 1T parâmetros com capacidades agênticas
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI lança Devstral Small 1.1 e Devstral Medium com All Hands AI
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI lança Devstral Small 1.1 e Devstral Medium com All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
Anthropic lança Claude Opus 4 e Sonnet 4 com raciocínio híbrido
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI lança Devstral, LLM agêntico para engenharia de software
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI lança o4-mini, um modelo de raciocínio multimodal mais rápido e barato
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI lança família GPT-4.1 com contexto de 1M de tokens e melhorias em codificação
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google apresenta o modelo experimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google apresenta o modelo de raciocínio Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet alcança 49% no SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI antecipa modelo de raciocínio o3 com avanços no ARC AGI e Frontier Math
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet alcança 49% no SWE-bench Verified com mínimo suporte de agente
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
Anthropic atualiza Claude 3.5 Sonnet, lança Claude 3.5 Haiku e versão beta de uso do computador
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI lança o SWE-bench Verified com subconjunto validado por humanos
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI lança o SWE-bench Verified com subconjunto validado por humanos
|