Une équipe de recherche de FAIR chez Meta, de l'Université d'Oxford et de University College London a introduit les Modèles de Préférence de Recherche en IA (RPM) pour aider les agents IA à classer les candidats d'expériences ML non exécutés. Cette approche répond au goulot d'étranglement où la génération d'idées est peu coûteuse mais la vérification par entraînement sur GPU est onéreuse.

  • Les RPM utilisent des LLM pré-entraînés figés sans aucun fine-tuning, s'appuyant sur le squelette open-source AIRA-dojo et Qwen3.6-27B comme colonne vertébrale.
  • Le système génère 15 candidats en parallèle et sélectionne un gagnant via un tournoi à élimination par paires fondé sur les scores de validation.
  • Deux variantes ont été testées : un juge uniquement en inférence et un juge agent qui exécute de courtes expériences pilotes dans un environnement sandboxé.
  • Sur AIRS-Bench, les RPM ont amélioré les scores normalisés moyens de 0.684 à 0.711 (uniquement inférence) et 0.729 (agent).
  • Les deux variantes ont atteint le score final de la baseline en environ 15 heures, offrant un gain de vitesse de 1,5–1,6× par rapport à une sélection aléatoire.

Les auteurs considèrent cela comme important car cela permet aux agents de concentrer les ressources de calcul sur les expériences les plus prometteuses, accélérant significativement les progrès de la recherche sans nécessiter de modèles de base plus puissants.