Un equipo de investigación de FAIR en Meta, la Universidad de Oxford y University College London ha introducido los Modelos de Preferencia de Investigación en IA (RPM) para ayudar a los agentes de IA a clasificar candidatos a experimentos de aprendizaje automático no ejecutados. Este enfoque aborda el cuello de botella donde la generación de ideas es barata pero la verificación mediante entrenamiento con GPU es costosa.

  • Los RPM utilizan LLMs preentrenados congelados sin ajuste fino, aprovechando el andamiaje de código abierto AIRA-dojo y Qwen3.6-27B como base.
  • El sistema genera 15 candidatos en paralelo y selecciona un ganador mediante un torneo de eliminación por pares basado en puntuaciones de validación.
  • Se probaron dos variantes: un juez solo de inferencia y un juez agente que ejecuta experimentos piloto cortos en un entorno aislado.
  • En AIRS-Bench, los RPM mejoraron las puntuaciones normalizadas promedio de 0.684 a 0.711 (solo inferencia) y 0.729 (agente).
  • Ambas variantes alcanzaron la puntuación final de la línea base en aproximadamente 15 horas, proporcionando una aceleración de 1.5–1.6× respecto a la selección aleatoria.

Los autores consideran esto importante porque permite a los agentes concentrar los recursos de cómputo en los experimentos más prometedores, acelerando significativamente el progreso de la investigación sin requerir modelos base más potentes.