A OpenAI afirma que seu modelo o3-mini, com alto raciocínio e acesso a ferramentas Python, alcança uma pontuação de 32% no benchmark FrontierMath. No entanto, a avaliação oficial independente da Epoch relata uma pontuação significativamente menor, de apenas 11%.
- A Epoch construiu o benchmark e tem melhores incentivos para uma pontuação precisa.
- A OpenAI relatou uma pontuação de 28% na camada de problemas mais difíceis, o que é suspeitamente próximo de sua pontuação geral.
- A Epoch publicou informações extensas sobre sua infraestrutura de teste e dados, enquanto a OpenAI publicou pouco.
- A discrepância pode decorrer da OpenAI usar um scaffold interno mais poderoso, mais computação no momento do teste ou um subconjunto diferente de problemas (180 vs 290).
A diferença nos resultados destaca a importância de metodologias de avaliação transparentes e verificação independente na benchmarking de grandes modelos de linguagem.