A Fundação ARC Prize publicou sua primeira análise pública dos modelos o3 e o4-mini da OpenAI nos benchmarks de raciocínio ARC-AGI. A avaliação revela que, embora esses modelos de ponta mostrem progresso significativo, eles ainda não resolveram o conjunto difícil ARC-AGI-2.

  • o3-medium alcançou 53% no conjunto Semi Private Eval do ARC-AGI-1, enquanto o4-mini-medium atingiu 41% com alta eficiência.
  • Tanto o3 quanto o4-mini marcaram abaixo de 3% no benchmark mais desafiador ARC-AGI-2.
  • Configurações de raciocínio elevadas resultaram em cobertura incompleta devido a timeouts ou saídas ausentes, tornando esses resultados inadequados para relatórios de ranking.
  • O modelo o3 de produção difere do anterior o3-preview ao integrar entradas visuais e usar diferentes restrições de dados de treinamento.

As descobertas destacam que o ARC-AGI-1 permanece como uma ferramenta sensível para medir as capacidades atuais dos modelos, enquanto o ARC-AGI-2 serve como um benchmark de próxima geração para futuros modelos que fecharem a lacuna entre o raciocínio humano e o da IA.