Benchmark · math

FrontierMath

20 resultados 15 modelos

FrontierMath é um benchmark da Epoch AI que mede o quão bem um modelo de IA resolve problemas matemáticos extremamente difíceis e originais, em nível de pesquisa. A pontuação é a porcentagem de problemas que o modelo responde corretamente, e os modelos atuais resolvem apenas uma pequena fração, longe da saturação.

Saiba mais
Exemplo
Um único problema inédito de uma área avançada como teoria dos números, geometria algébrica ou combinatória, cuja solução exige conhecimento profundo e se reduz a uma única resposta final definida (por exemplo, um número inteiro específico ou um objeto matemático exato).
Pontuação
A métrica é a acurácia (accuracy): a fração de problemas cuja resposta final coincide exatamente com a resposta de referência, expressa em porcentagem.
Verificação
Cada problema tem uma única resposta definida e verificável automaticamente, então uma solução só é aceita quando corresponde exatamente à de referência; os problemas são criados por matemáticos especialistas para que seja quase impossível acertar por adivinhação.
Por que importa
Como os problemas são inéditos, ele resiste à memorização e continua longe de ser resolvido, sendo um dos poucos benchmarks de matemática que ainda separa com clareza o raciocínio matemático avançado real do simples reconhecimento de padrões.
Exemplo resolvido
Tarefa
Determine o número de inteiros $n$ com $0 \le n < 3^{13}$ para os quais o coeficiente binomial central $\binom{2n}{n}$ não é divisível por $3$.
Solução
Pelo teorema de Kummer, $3 \nmid \binom{2n}{n}$ exatamente quando somar $n+n$ na base 3 não gera vai-um, ou seja, todo dígito de $n$ na base 3 é 0 ou 1. Em $0 \le n < 3^{13}$ isso dá 2 opções para cada um dos 13 dígitos, então a contagem é $2^{13} = 8192$.
Explicação
O teorema de Kummer dá $v_3\binom{2n}{n}$ como o número de vai-uns ao somar $n$ com ele mesmo na base 3; zero vai-um obriga cada dígito na base 3 a ser 0 ou 1, isto é, 2 opções por dígito em 13 dígitos. Correção: um verificador automático compara exatamente o único inteiro final (8192).
0 14 28 42 56 2024-11-08 2025-08-01 2026-04-25 Claude 3.5 Sonnet · 2 · 2024-11-08 Gemini 1.5 Pro · 2 · 2024-11-08 GPT-4o · 2 · 2024-11-08 o1-preview · 2 · 2024-11-08 o3 · 25 · 2024-12-20 o3 · 25 · 2024-12-22 o3 · 25.2 · 2025-01-19 o3 · 25 · 2025-01-29 o3 · 10 · 2025-04-20 o3-mini with high reasoning and a Python tool · 32 · 2025-03-17 Gemini 2.5 Deep Think · 29 · 2025-10-09 GPT-5 Pro · 13 · 2025-10-13 Claude 4.5 Opus · 21 · 2025-12-04 Gemini 3 Pro · 38 · 2025-12-04 GPT-5.2 Thinking · 40.3 · 2025-12-11 GPT-5.2 Pro · 31 · 2026-01-23 GPT-5.5 Pro · 39.6 · 2026-04-23 GPT-5.5 · 35.4 · 2026-04-23 GPT-5.5 · 51.7 · 2026-04-25 OpenAI o3 · 25.2 · 2024-12-20
Claude 3.5 Sonnet Gemini 1.5 Pro GPT-4o o1-preview o3 o3-mini with high reasoning and a Python tool Gemini 2.5 Deep Think GPT-5 Pro Claude 4.5 Opus Gemini 3 Pro GPT-5.2 Thinking GPT-5.2 Pro GPT-5.5 Pro GPT-5.5 OpenAI o3
Linha do tempo
Data Modelo Pontuação Fonte
2026-04-25 GPT-5.5 51.7% OpenAI lança GPT-5.5, um modelo retreinado do zero com processamento omnimodal nativo
2026-04-23 GPT-5.5 Pro 39.6% OpenAI lança GPT-5.5 com capacidades agênticas e preço de API dobrado
2026-04-23 GPT-5.5 35.4% OpenAI lança GPT-5.5 com capacidades agênticas e preço de API dobrado
2026-01-23 GPT-5.2 Pro 31.0% GPT-5.2 Pro marca 31% no FrontierMath Tier 4
2025-12-11 GPT-5.2 Thinking 40.3% OpenAI lança modelos GPT-5.2 Pro e Thinking para ciência e matemática
2025-12-04 Claude 4.5 Opus 21.0% Epoch AI lança o Hub de Data Centers de Fronteira e analisa benchmark OSWorld
2025-12-04 Gemini 3 Pro 38.0% Epoch AI lança o Hub de Data Centers de Fronteira e analisa benchmark OSWorld
2025-10-13 GPT-5 Pro 13.0% GPT-5 Pro resolve problema de Nível 4 do FrontierMath, ultrapassando o Gemini 2.5 Deep Think
2025-10-09 Gemini 2.5 Deep Think 29.0% Epoch AI avalia as capacidades matemáticas do Gemini 2.5 Deep Think
2025-04-20 o3 10.0% o3 da OpenAI tem pontuação menor no FrontierMath do que inicialmente afirmado
2025-03-17 o3-mini with high reasoning and a Python tool 32.0% Avaliação da Epoch de o3-mini no FrontierMath resulta em 11% contra 32% da OpenAI
2025-01-29 o3 25.0% Modelo o3 da OpenAI alcança 25% no benchmark Frontier Math
2025-01-19 o3 25.2% OpenAI financiou o benchmark FrontierMath antes do recorde do o3
2024-12-22 o3 25.0% o3 da OpenAI obtém 25% no benchmark de matemática avançada FrontierMath
2024-12-20 o3 25.0% OpenAI antecipa modelo de raciocínio o3 com avanços no ARC AGI e Frontier Math
2024-12-20 OpenAI o3 25.2% Epoch AI
2024-11-08 Claude 3.5 Sonnet 2.0% Epoch AI lança o benchmark FrontierMath para avaliar raciocínio matemático avançado
2024-11-08 Gemini 1.5 Pro 2.0% Epoch AI lança o benchmark FrontierMath para avaliar raciocínio matemático avançado
2024-11-08 GPT-4o 2.0% Epoch AI lança o benchmark FrontierMath para avaliar raciocínio matemático avançado
2024-11-08 o1-preview 2.0% Epoch AI lança o benchmark FrontierMath para avaliar raciocínio matemático avançado