शोधकर्ताओं ने TasteVal का परिचय दिया, एक ऐसा बेंचमार्क जो अग्रणी AI मॉडल्स के प्रयोगात्मक शोध स्वाद का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें वे प्रयोगों को डिज़ाइन करने और परिणामों को कुशलता से व्याख्या करने की उनकी क्षमता को मापते हैं। अध्ययन में 2023 और 2026 के बीच जारी किए गए 20 मॉडल्स का आकलन किया गया है, जहाँ एक शोधकर्ता एजेंट बार-बार प्रयोगों को डिज़ाइन करता है जबकि एक स्थिर कोडर एजेंट उन्हें लागू करता है।

  • TasteVal प्रयोगात्मक स्वाद को कम्प्यूट दक्षता के रूप में परिभाषित करता है, इसे मानव विशेषज्ञों के सापेक्ष प्रयोगात्मक कम्प्यूट के गुणक के रूप में परिभाषित करता है।
  • मूल्यांकन में मॉडल की कार्यप्रदर्शनी का तुलना 24 भर्ती किए गए मानव विशेषज्ञों द्वारा स्थापित आधार रेखा के साथ किया जाता है।
  • Opus 5.5 सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल निकला, जिसने लगभग आधार रेखाधारकों की औसत लागत का 1/30वाँ होने पर 2.3x के कम्प्यूट गुणक के साथ विशेषज्ञ आधार रेखा को पार किया।
  • डेटा संकेत देता है कि अग्रणी मॉडल्स के लिए कम्प्यूट गुणक दिसंबर 2025 से लगभग हर 3.0 महीने में दोगुना हो रहा है, जो पिछले दर (हर 14 महीने) की तुलना में तेज़ हुआ है।

बेंचमार्क AI दक्षता लाभों में महत्वपूर्ण त्वरण को उजागर करता है, यह सुझाव देते हुए कि प्रयोगात्मक स्वाद भविष्य के AI प्रगति का पूर्वानुमान लगाने में एक महत्वपूर्ण कारक बन रहा है।