Исследовательская команда из FAIR в Meta, Оксфордского университета и Университетского колледжа Лондона представила модели предпочтений для исследований с ИИ (RPMs), чтобы помочь агентам ИИ ранжировать кандидаты на машинное обучение эксперименты, которые ещё не были выполнены. Этот подход решает проблему узкого места, где генерация идей обходится дёшево, но проверка через GPU-тренировку — дорого.

  • RPMs используют замороженные предварительно обученные LLM без дообучения, опираясь на open-source каркас AIRA-dojo и Qwen3.6-27B в качестве основы.
  • Система генерирует 15 параллельных кандидатов и выбирает одного победителя через парный турнир на выбывание, основанный на оценках валидации.
  • Были протестированы два варианта: судья только на основе инференса и агентный судья, запускающий короткие пилотные эксперименты в изолированной среде.
  • На AIRS-Bench RPMs улучшили средние нормализованные оценки с 0.684 до 0.711 (только инференс) и 0.729 (агентный).
  • Оба варианта достигли финального результата базовой линии примерно за 15 часов, обеспечив ускорение в 1.5–1.6× по сравнению со случайным выбором.

Авторы считают это важным, потому что это позволяет агентам сосредоточить вычислительные ресурсы на наиболее перспективных экспериментах, значительно ускоряя прогресс исследований без необходимости более сильных базовых моделей.