A OpenAI apresentou uma prévia de seu novo modelo de linguagem de raciocínio o3, sinalizando progresso rápido nas capacidades de IA antes do lançamento público em janeiro de 2025. O anúncio destaca saltos significativos de desempenho em relação aos modelos anteriores mais avançados, como Gemini 1.5 Pro e Claude 3.5 Sonnet.
- o3 é o primeiro modelo a ultrapassar o limiar de 85% no conjunto público do prêmio ARC AGI, um benchmark projetado para medir inteligência fluida semelhante à humana.
- Ele alcança uma pontuação de 25% no benchmark Frontier Math, um aumento substancial em relação ao estado da arte anterior de 2%.
- O modelo atinge o nível de desempenho de Grande Mestre Internacional no Codeforces e estabelece um novo estado da arte no SWE-Bench-Verified com uma pontuação de 71,7%.
- A OpenAI também publicou pesquisas sobre alinhamento deliberativo, demonstrando como modelos de classe o1 podem aprimorar estudos de segurança e alinhamento.
Esses resultados sugerem que os modelos de raciocínio estão começando a entregar valor além de domínios verificáveis, como matemática e programação, potencialmente acelerando o progresso em todo o ecossistema de pesquisa em IA.