研究者たちは、最先端AIモデルの実験的リサーチの品味を評価するために設計されたベンチマークであるTasteValを導入した。これは、実験の設計と結果の解釈における効率性を測定することによって行われる。本研究は、2023年から2026年の間にリリースされた20つのモデルを評価し、研究者エージェントが反復的に実験を設計し、固定されたコーダーエージェントがそれを実装するという8つの新規タスクを用いた。

  • TasteValは、計算効率として実験的品味を運用化し、それを人間の専門家に対する相対的な実験用計算量の乗数として定義する。
  • 評価では、モデルのパフォーマンスを、24人の募集された人間専門家が各タスクで確立したベースラインと比較する。
  • Opus 5.5が最良のパフォーマンスを示すモデルとして浮上し、約1/30の費用で計算乗数2.3倍という結果を出し、専門家のベースラインを上回った。
  • データは、2025年12月以降、最先端モデルの計算乗数が約3.0ヶ月ごとに2倍になっており、以前の14ヶ月ごとのペースから加速していることを示している。

このベンチマークは、AIの効率性向上における顕著な加速を浮き彫りにし、実験的品味が将来のAI進歩を予測する上で重要な要因になりつつあることを示唆している。