OpenAI a publié les modèles o1-preview et o1-mini, entraînés pour imiter le raisonnement en générant et affinant des tokens de raisonnement avant de fournir une réponse finale. Les tests sur l'ensemble d'évaluation public ARC-AGI montrent que les deux variantes o1 surpassent GPT-4o en précision.

  • o1-preview atteint une précision comparable à celle de Claude 3.5 Sonnet d'Anthropic mais prend environ 10 fois plus de temps pour accomplir les tâches.
  • La résolution des 400 tâches publiques ARC-AGI a pris 70 heures à o1, contre seulement 30 minutes pour GPT-4o et Claude 3.5 Sonnet.
  • Les modèles utilisent un paradigme de chaîne de pensée appliqué à la fois lors de l'entraînement et de l'inférence, exploitant l'apprentissage par renforcement pour affiner les stratégies.
  • Les performances évoluent avec le calcul au moment du test, montrant une relation log-linéaire entre la précision et le nombre de tokens de raisonnement utilisés.

Les résultats soulignent que bien qu'une augmentation du calcul au moment du test améliore la précision, l'efficacité reste un facteur critique pour les applications pratiques et les évaluations.