OpenAI ha anunciado o3, su modelo de razonamiento de próxima generación, que establece nuevos récords en razonamiento, programación y resolución de problemas matemáticos. El modelo obtiene una puntuación de 75,7 % en la evaluación semi-privada ARC-AGI eval en modo de bajo cómputo y 87,5 % en modo de alto cómputo.
- o3 obtiene 75,7 % en ARC-AGI (bajo cómputo) y 87,5 % (alto cómputo), superando el umbral de nivel humano del 85 %.
- Logra una puntuación del 96,7 % en la Olimpiada Matemática Americana de 2024 (AIME) y 25,2 % en la Benchmark Frontier Math de EpochAI.
- En programación, o3 obtiene 71,7 en SWE-Bench Verified (22,8 puntos más que o1) y una calificación Elo de 2.727 en Codeforces.
- El modelo tiene una ventana de contexto de 128K tokens y se destaca por ser significativamente más costoso de ejecutar que las iteraciones anteriores.