Os pesquisadores desenvolveram o Replica, um espaço de tarefas escalável para replicação de artigos, e introduziram um juiz baseado em rubricas gerado automaticamente para fornecer sinais de recompensa de baixo ruído que se alinham com a avaliação humana.

  • A equipe realizou o pós-treinamento do Faraday, um agente "AI Scientist" de 27B parâmetros que utiliza agentes de codificação como ferramentas.
  • O Faraday supera o desempenho do Claude Opus 4.8 e do GPT-5.5 em tarefas de replicação reservadas.
  • A análise qualitativa indica que o Faraday adota uma abordagem mais fundamentada cientificamente durante as execuções.

Os autores acreditam que esses resultados fornecem um degrau rumo a agentes de IA capazes de inovação científica de longo prazo sem exigir harnesses complexos.