O autor alcançou uma nova precisão de estado da arte de 50% no conjunto de teste público para o benchmark de raciocínio ARC-AGI, aproveitando o GPT-4o para gerar e avaliar milhares de implementações em Python por problema.

  • O método gera aproximadamente 8.000 programas Python por problema usando prompts few-shot com raciocínio passo a passo.
  • Os programas são selecionados com base em sua correção em relação aos exemplos fornecidos, com uma abordagem de ensemble para variações no tamanho da grade.
  • Uma fase de revisão tenta corrigir as 12 implementações mais promissoras mostrando-lhes sua saída real e pedindo correções.
  • O estado da arte anterior era de 34% de precisão, enquanto os humanos alcançam 85% na distribuição de treinamento mais fácil.

Este resultado demonstra que os grandes modelos de linguagem atuais podem performar decentemente bem em tarefas complexas de raciocínio por meio de amostragem extensiva e verificação, desafiando alegações de que eles carecem de capacidades de aprendizado durante a inferência.