A OpenAI anunciou seu novo modelo o3, que obteve uma pontuação de 25% no benchmark Frontier Math, um salto significativo em relação à média anterior de 2% para IAs generativas. Este resultado destaca as rápidas melhorias nas capacidades de raciocínio matemático da IA.

  • O Frontier Math é um benchmark privado de perguntas matemáticas desafiadoras, projetado para testar habilidades semelhantes às humanas sem depender de dados memorizados.
  • O modelo o3 utiliza cadeias iterativas de pensamento, permitindo que ele avalie e corrija seus próprios passos de raciocínio antes de responder.
  • Esse processo requer computação substancial, com algumas questões individuais custando mais de US$ 1000 para serem respondidas.
  • Diferente de modelos especializados como o AlphaProof do Google DeepMind, o o3 é uma IA geral que exibe habilidades matemáticas avançadas.

O artigo sugere que, se os custos diminuírem e as pontuações melhorarem, matemáticos de IA poderiam transformar métodos formais automatizando processos de verificação atualmente limitados pela escassez de especialistas humanos.