MetaのFAIR、オックスフォード大学、ユニバーシティ・カレッジ・ロンドンの研究チームは、AIエージェントが未実行の機械学習実験候補を順位付けするのを支援するために、AI Research Preference Models(RPMs)を導入しました。このアプローチは、アイデア生成は安価だがGPUによるトレーニングでの検証が高コストであるというボトルネックに対処します。
- RPMsはファインチューニングを行わない凍結済み事前学習済みLLMを使用し、オープンソースのAIRA-dojoスキャフォールドとQwen3.6-27Bをバックボーンとして活用しています。
- システムは15個の並列候補を生成し、検証スコアに基づくペアワイズノックアウトトーナメントを通じて1つの勝者を選択します。
- 2つのバリエーションがテストされました:推論のみを行うジャッジと、サンドボックス環境で短いパイロット実験を実行するエージェント型ジャッジです。
- AIRS-Benchにおいて、RPMsは平均正規化スコアを0.684から0.711(推論のみ)および0.729(エージェント型)に向上させました。
- 両方のバリエーションで、ベースラインの最終スコアが約15時間で達成され、ランダム選択と比較して1.5–1.6倍の高速化が実現しました。
著者たちは、これによりエージェントが最も有望な実験に計算資源を集中させられ、より強力な基本モデルを必要とせずに研究の進捗を大幅に加速できると考えています。