Jeremy Berman estabeleceu um novo recorde público de 53,6% de precisão no ranking do ARC-AGI-Pub ao aplicar um algoritmo evolutivo ao modelo Sonnet 3.5 da OpenAI, superando a pontuação máxima anterior de 43%. A abordagem trata o LLM como um motor de evolução que gera e refina funções de transformação em Python em vez de grades de saída diretas.

O método envolve gerar ondas de funções candidatas em Python e avaliá-las contra os exemplos de treinamento fornecidos usando uma avaliação de aptidão em dois níveis.

  • As funções com melhor desempenho são selecionadas como pais para criar prompts de revisão para as gerações subsequentes.
  • O processo itera por várias gerações, potencialmente gerando até 500 funções por desafio usando 31 prompts dinâmicos.
  • As soluções finais são derivadas das duas melhores funções em todas as gerações, enviadas como grades de saída candidatas.

Berman sugere que a escalabilidade da computação em tempo de teste guiada por princípios evolutivos permite que os LLMs compensem limitações de generalização e pode indicar um caminho em direção à Inteligência Geral Artificial.