A OpenAI anunciou o o3, seu modelo de raciocínio de próxima geração, que estabelece novos recordes em raciocínio, programação e resolução de problemas matemáticos. O modelo alcança uma pontuação de 75,7% na avaliação semi-privada ARC-AGI eval no modo de baixo cálculo e 87,5% no modo de alto cálculo.

  • o3 obtém 75,7% no ARC-AGI (baixo cálculo) e 87,5% (alto cálculo), superando o limiar de nível humano de 85%.
  • Ele alcança uma pontuação de 96,7% na Olimpíada Americana de Matemática de 2024 (AIME) e 25,2% no Frontier Math Benchmark da EpochAI.
  • Em programação, o3 obtém 71,7 no SWE-Bench Verified (22,8 pontos a mais que o o1) e uma classificação Elo de 2.727 no Codeforces.
  • O modelo possui uma janela de contexto de 128K tokens e é notável por ser significativamente mais caro para executar do que as iterações anteriores.