OpenAI ha presentado su nuevo modelo de lenguaje de razonamiento o3, señalando un rápido progreso en las capacidades de IA antes de su lanzamiento público a finales de enero de 2025. El anuncio destaca saltos significativos en el rendimiento frente a modelos anteriores de última generación como Gemini 1.5 Pro y Claude 3.5 Sonnet.
- o3 es el primer modelo en superar el umbral del 85% en el conjunto público del premio ARC AGI, un punto de referencia diseñado para medir la inteligencia fluida similar a la humana.
- Alcanza una puntuación del 25% en el punto de referencia Frontier Math, un aumento sustancial respecto al estado de la técnica anterior del 2%.
- El modelo alcanza un rendimiento de nivel Gran Maestro Internacional en Codeforces y establece un nuevo estado de la técnica en SWE-Bench-Verified con una puntuación del 71.7%.
- OpenAI también publicó investigación sobre alineación deliberativa, demostrando cómo los modelos de clase o1 pueden mejorar los estudios de seguridad y alineación.
Estos resultados sugieren que los modelos de razonamiento están comenzando a aportar valor más allá de dominios verificables como las matemáticas y la programación, acelerando potencialmente el progreso en todo el ecosistema de investigación de IA.