Resultados de benchmark independentes divulgados pela Epoch AI mostram que o modelo o3, lançado publicamente pela OpenAI, obteve aproximadamente 10% no conjunto de dados FrontierMath, ficando significativamente abaixo da pontuação superior a 25% destacada inicialmente pela empresa durante sua apresentação em dezembro.
- A Epoch AI avaliou o modelo o3 liberado usando uma versão atualizada do benchmark FrontierMath e encontrou uma pontuação de cerca de 10%.
- A afirmação inicial da OpenAI de mais de 25% foi alcançada usando configurações agressivas de computação no momento do teste em um scaffold interno mais poderoso do que a versão pública.
- A ARC Prize Foundation confirmou que o o3 público é ajustado para chat e uso em produtos, com níveis menores de computação do que a versão de preview testada por eles.
- Funcionários técnicos da OpenAI declararam que o modelo de produção é otimizado para eficiência de custos e velocidade, em vez de desempenho máximo em benchmarks.
A discrepância destaca a importância de verificar benchmarks de terceiros e esclarece que o modelo liberado prioriza a utilidade no mundo real em vez de pontuações acadêmicas máximas.