OpenAI anunció su nuevo modelo o3, que logró un puntaje del 25% en la prueba Frontier Math, un salto significativo respecto al promedio anterior del 2% para IAs generativas. Este resultado destaca las rápidas mejoras en las capacidades de razonamiento matemático de la IA.

  • Frontier Math es una prueba privada de preguntas matemáticas desafiantes diseñada para evaluar habilidades similares a las humanas sin depender de datos memorizados.
  • El modelo o3 utiliza cadenas iterativas de pensamiento, lo que le permite evaluar y corregir sus propios pasos de razonamiento antes de responder.
  • Este proceso requiere un cálculo sustancial, con algunas preguntas individuales que cuestan más de 1000 dólares en responder.
  • A diferencia de modelos especializados como AlphaProof de Google DeepMind, o3 es una IA general que exhibe habilidades matemáticas avanzadas.

El artículo sugiere que si los costos disminuyen y las puntuaciones mejoran, los matemáticos de IA podrían transformar los métodos formales automatizando los procesos de verificación actualmente limitados por la escasez de expertos humanos.