Para peneliti memperkenalkan TasteVal, sebuah benchmark yang dirancang untuk mengevaluasi rasa penelitian eksperimental dari model AI terdepan dengan mengukur kemampuan mereka dalam merancang eksperimen dan menafsirkan hasil secara efisien. Studi ini menilai 20 model yang dirilis antara 2023 dan 2026 menggunakan delapan tugas baru di mana agen Researcher merancang eksperimen secara iteratif sementara agen Coder yang tetap mengimplementasikannya.

  • TasteVal mengoperasionalkan rasa eksperimental sebagai efisiensi komputasi, mendefinisikannya sebagai pengali komputasi eksperimental relatif terhadap pakar manusia.
  • Evaluasi ini membandingkan kinerja model dengan garis dasar yang ditetapkan oleh 24 pakar manusia yang direkrut di seluruh tugas.
  • Opus 5.5 muncul sebagai model dengan kinerja terbaik, melampaui garis dasar pakar dengan pengali komputasi sebesar 2.3x pada sekitar 1/30 dari biaya rata-rata para penentu garis dasar.
  • Data menunjukkan bahwa pengali komputasi untuk model terdepan telah berlipat ganda kira-kira setiap 3.0 bulan sejak Desember 2025, mempercepat dari laju sebelumnya setiap 14 bulan.

Benchmark ini menyoroti percepatan signifikan dalam peningkatan efisiensi AI, yang menunjukkan bahwa rasa eksperimental menjadi faktor kritis dalam memproyeksikan kemajuan AI di masa depan.