A OpenAI afirma que seu modelo o3-mini, com alto raciocínio e acesso a ferramentas Python, alcança uma pontuação de 32% no benchmark FrontierMath. No entanto, a avaliação oficial independente da Epoch relata uma pontuação significativamente menor, de apenas 11%.

  • A Epoch construiu o benchmark e tem melhores incentivos para uma pontuação precisa.
  • A OpenAI relatou uma pontuação de 28% na camada de problemas mais difíceis, o que é suspeitamente próximo de sua pontuação geral.
  • A Epoch publicou informações extensas sobre sua infraestrutura de teste e dados, enquanto a OpenAI publicou pouco.
  • A discrepância pode decorrer da OpenAI usar um scaffold interno mais poderoso, mais computação no momento do teste ou um subconjunto diferente de problemas (180 vs 290).

A diferença nos resultados destaca a importância de metodologias de avaliação transparentes e verificação independente na benchmarking de grandes modelos de linguagem.