O novo sistema o3 da OpenAI, treinado no conjunto de treinamento público ARC-AGI-1, obteve 75,7% no conjunto de avaliação semi-privada dentro de um limite de computação de $10k e 87,5% com configuração de alta computação.

  • A pontuação de alta eficiência qualifica-se como 1º lugar no ranking público sob as regras do ARC-AGI-Pub.
  • Os testes foram realizados em dois níveis de computação: 6 amostras para alta eficiência e 1024 amostras (172x computação) para baixa eficiência.
  • A OpenAI confirmou que a versão testada difere da o3 oficialmente lançada, com resultados atualizados em breve.

O ARC Prize vê isso como um aumento significativo nas capacidades de IA, demonstrando novas habilidades de adaptação a tarefas não vistas nos modelos anteriores da família GPT.