Uma equipe de pesquisa da FAIR na Meta, da Universidade de Oxford e do University College London apresentou os Modelos de Preferência de Pesquisa em IA (RPMs) para ajudar agentes de IA a classificar candidatos a experimentos de aprendizado de máquina não executados. Esta abordagem aborda o gargalo em que a geração de ideias é barata, mas a verificação por meio de treinamento em GPU é cara.
- Os RPMs usam LLMs pré-treinados congelados, sem ajuste fino, aproveitando a estrutura open-source AIRA-dojo e o Qwen3.6-27B como base.
- O sistema gera 15 candidatos em paralelo e seleciona um vencedor por meio de um torneio eliminatório pareado fundamentado em pontuações de validação.
- Duas variantes foram testadas: um juiz apenas de inferência e um juiz agêntico que executa experimentos piloto curtos em um ambiente isolado.
- No AIRS-Bench, os RPMs melhoraram as pontuações normalizadas médias de 0.684 para 0.711 (apenas inferência) e 0.729 (agêntico).
- Ambas as variantes alcançaram a pontuação final da linha de base em aproximadamente 15 horas, proporcionando um aumento de velocidade de 1,5–1,6× em relação à seleção aleatória.
Os autores consideram isso importante porque permite que os agentes concentrem recursos computacionais nos experimentos mais promissores, acelerando significativamente o progresso da pesquisa sem exigir modelos base mais fortes.