OpenAI lanzó los modelos o1-preview y o1-mini, entrenados para emular el razonamiento generando y refinando tokens de razonamiento antes de proporcionar una respuesta final. Las pruebas en el conjunto de datos público ARC-AGI muestran que ambas variantes de o1 superan a GPT-4o en precisión.
- o1-preview logra una precisión comparable a la de Claude 3.5 Sonnet de Anthropic, pero tarda aproximadamente 10 veces más en completar las tareas.
- Resolver las 400 tareas públicas de ARC-AGI tomó a o1 70 horas, en comparación con solo 30 minutos para GPT-4o y Claude 3.5 Sonnet.
- Los modelos utilizan un paradigma de cadena de pensamiento aplicado tanto durante el entrenamiento como la inferencia, aprovechando el aprendizaje por refuerzo para refinar estrategias.
- El rendimiento escala con el cómputo durante la prueba, mostrando una relación log-lineal entre la precisión y la cantidad de tokens de razonamiento utilizados.
Los resultados destacan que, aunque el aumento del cómputo durante la prueba mejora la precisión, la eficiencia sigue siendo un factor crítico para la aplicación práctica y la evaluación.