| 2026-09-29 |
Qwen3.8-Flash-Next (IQ3_XXS) |
91.41% |
ISTA lança GGUFs GSQ-RCO para Qwen3.8-Flash-Next e compilação Coder com 50% de especialistas podados
|
| 2026-09-25 |
VeriLoop E2 |
93.94% |
VeriLoop E2: modelo pós-treinado de 27B com escada GGUF de BF16 a IQ1_M
|
| 2026-09-11 |
GPT-6 Astra |
96.3% |
OpenAI lança GPT-6 Astra, lidera rankings com menor custo
|
| 2026-09-10 |
DeepSeek-V4.1-Flash |
90.9% |
DeepSeek lança modelo V4.1-Flash com suporte multimodal nativo
|
| 2026-09-07 |
K2-Horizon-375B-A23B |
87.3% |
IFM lança K2 Horizon: seis modelos Apache 2.0 de 0,9B a 375B
|
| 2026-08-28 |
GLM-5.3 |
91.72% |
Z.ai ajusta finamente o GLM-5.3 para ganhos em cibersegurança
|
| 2026-08-25 |
QAH model (GPT-OSS 120B compressed to 60B, MXFP4) |
67.4% |
QAH da Multiverse Computing faz GPT-OSS em 4 bits superar sua versão original de precisão completa
|
| 2026-08-21 |
Grok 4.6 |
94.9% |
SpaceXAI apresenta Grok 4.6 com dados do Cursor para trabalho agêntico
|
| 2026-08-03 |
Qwen3.8-Max |
92.6% |
Alibaba lança Qwen3.8-Max, um modelo MoE de 2,4T parâmetros
|
| 2026-08-03 |
Inkling-Small |
89.5% |
Thinking Machines Lab lança Inkling-Small, um modelo MoE multimodal de pesos abertos com 276B
|
| 2026-07-17 |
Kimi K3 |
93.5% |
Moonshot AI lança o Kimi K3 aberto, um modelo MoE de 2,8T parâmetros com contexto de 1M
|
| 2026-07-17 |
GPT-Live-1 |
84.2% |
OpenAI lança modelos de voz full-duplex e tribunal alemão responsabiliza o Google por Visões Gerais da IA
|
| 2026-03-25 |
o3 |
87.7% |
OpenAI anuncia a aposentadoria do o3 do ChatGPT e compartilha pontuações de benchmarks
|
| 2026-02-25 |
Grok 4 |
87.7% |
xAI lança modelo de raciocínio Grok 4 com fortes benchmarks agênticos e de codificação
|
| 2026-02-05 |
Claude Opus 4.6 |
91.3% |
Anthropic lança Claude Opus 4.6 com janela de contexto de 1M e melhorias agênticas
|
| 2026-01-27 |
Kimi K2.5 |
87.6% |
Moonshot lança Kimi K2.5 com tecnologia Agent Swarm
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI lança modelos GPT-5.2 Pro e Thinking para ciência e matemática
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
|
| 2025-12-11 |
GPT-5.2 Thinking |
92.4% |
OpenAI apresenta GPT-5.2 com capacidades aprimoradas de codificação, contexto longo e raciocínio
|
| 2025-12-11 |
GPT-5.2 Pro |
93.2% |
OpenAI lança modelos GPT-5.2 Pro e Thinking para ciência e matemática
|
| 2025-12-04 |
Gemini 3 Pro |
93.0% |
Epoch AI lança o Hub de Data Centers de Fronteira e analisa benchmark OSWorld
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
|
| 2025-11-18 |
Gemini 3 Pro |
91.9% |
Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
|
| 2025-11-18 |
Gemini 3 Deep Think |
93.8% |
Google lança Gemini 3 Pro com capacidades de raciocínio e multimodais de última geração
|
| 2025-10-24 |
Claude 3 Opus |
60.0% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
O1 |
77.0% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
Claude Opus 4.6 |
91.3% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
Gemini 3 Pro |
91.9% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
GPT-5.2 |
92.4% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
Gemini 3.1 Pro Preview |
94.1% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
Aristotle-X1 |
92.4% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-10-24 |
GPT-4 |
39.0% |
Benchmark GPQA-Diamond: Pontuações, Ranking e Como os Modelos de IA se Comparam
|
| 2025-09-30 |
Claude Sonnet 4.5 |
83.4% |
Anthropic lança Claude Sonnet 4.5 com capacidades aprimoradas de codificação e agentes
|
| 2025-09-22 |
DeepSeek-V3.1-Terminus |
74.24% |
DeepSeek lança DeepSeek-V3.1-Terminus com correções de idioma e agentes
|
| 2025-08-07 |
GPT-5 pro |
88.4% |
OpenAI apresenta GPT-5 com roteamento unificado e raciocínio de nível especialista
|
| 2025-08-07 |
GPT-5 pro |
89.4% |
OpenAI lança GPT-5 unificado com roteamento em tempo real e acesso gratuito
|
| 2025-08-07 |
GPT-5 Pro |
88.4% |
OpenAI lança GPT-5 com raciocínio adaptativo e arquitetura unificada
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Kimi K2: modelo MoE aberto com 1T de parâmetros e otimizador MuonClip
|
| 2025-07-28 |
Kimi K2 |
75.1% |
Moonshot lança Kimi K2, um modelo MoE agêntico aberto com 32B de parâmetros ativados
|
| 2025-05-30 |
Deepseek-R1-0528 |
81.0% |
DeepSeek atualiza modelo R1 com raciocínio aprimorado e melhores pontuações em benchmarks
|
| 2025-05-22 |
Claude Sonnet 4 |
70.0% |
Anthropic apresenta Claude Opus 4 e Sonnet 4 com pensamento estendido e uso de ferramentas
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic apresenta Claude Opus 4 e Sonnet 4 com pensamento estendido e uso de ferramentas
|
| 2025-05-22 |
Claude Opus 4 |
74.9% |
Anthropic lança Claude Opus 4 e Sonnet 4 com medidas de segurança ASL-3
|
| 2025-04-16 |
OpenAI o3 |
87.7% |
OpenAI
|
| 2025-04-15 |
Gemini 2.0 Flash |
60.1% |
Google lança Gemini 2.0 Flash com qualidade aprimorada e o dobro da velocidade do Gemini 1.5 Pro
|
| 2025-04-14 |
GPT‑4.1 nano |
50.3% |
OpenAI lança GPT-4.1, GPT-4.1 mini e GPT-4.1 nano na API
|
| 2025-04-10 |
Seed1.5-Thinking |
77.3% |
Seed1.5-Thinking usa aprendizado por reforço para melhorar o raciocínio
|
| 2025-04-05 |
Gemini 2.5 Pro |
84.0% |
Google amplia acesso ao Gemini 2.5 Pro em meio a resultados sólidos de benchmark
|
| 2025-03-26 |
Gemini 2.5 Pro |
84.0% |
Google lança modelo de raciocínio experimental Gemini 2.5 Pro com contexto de 1M tokens
|
| 2025-03-25 |
Gemini 2.5 Pro (experimental) |
84.0% |
Google DeepMind lança modelo experimental Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
84.0% |
Google DeepMind
|
| 2025-03-24 |
DeepSeek-V3-0324 |
68.4% |
DeepSeek-V3-0324 melhora raciocínio, programação e escrita em chinês em relação ao DeepSeek-V3
|
| 2025-03-11 |
Grok 3 |
84.6% |
xAI lança Grok 3 com raciocínio profundo e contexto de milhão de tokens
|
| 2025-03-05 |
GPT-4.5 |
71.4% |
OpenAI lança GPT-4.5, seu maior modelo, para o ChatGPT Plus
|
| 2025-02-26 |
OpenAI o3-mini |
78.0% |
Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
|
| 2025-02-26 |
Grok 3 Beta |
84.6% |
Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
|
| 2025-02-26 |
DeepSeek R1 |
71.5% |
Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
|
| 2025-02-26 |
Claude 3.5 Sonnet |
65.0% |
Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
|
| 2025-02-26 |
Claude 3.7 Sonnet |
84.8% |
Comparação de benchmarks entre Claude 3.7 Sonnet, o3-mini, R1 e Grok 3 Beta
|
| 2025-02-24 |
Claude 3.7 Sonnet |
84.8% |
Anthropic lança Claude 3.7 Sonnet com controle dinâmico de raciocínio
|
| 2025-02-19 |
Grok 3 (Think) |
84.6% |
xAI lança Grok 3 Beta e agente DeepSearch
|
| 2024-12-20 |
o3 |
87.7% |
OpenAI lança modelo o3 com alto desempenho em raciocínio e programação
|
| 2024-11-28 |
QwQ-32B-Preview |
65.2% |
Qwen lança QwQ-32B-Preview, um modelo de raciocínio experimental
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
|
| 2024-07-15 |
Qwen2-72B |
37.9% |
Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados
|
| 2024-06-20 |
Claude 3.5 Sonnet |
59.4% |
Anthropic
|
| 2023-11-20 |
GPT-4 based baseline |
39.0% |
GPQA: Um benchmark de perguntas e respostas de nível de pós-graduação à prova do Google
|