يقدم الباحثون TasteVal، وهو معيار مصمم لتقييم ذوق البحث التجريبي لنماذج الذكاء الاصطناعي المتطورة من خلال قياس قدرتها على تصميم التجارب وتفسير النتائج بكفاءة. تقيّم الدراسة 20 نموذجاً أُطلقت بين عامي 2023 و2026 باستخدام ثمانية مهام جديدة حيث يقوم وكيل باحث (Researcher agent) بتصميم التجارب بشكل تكراري بينما ينفذها وكيل مبرمج ثابت (Coder agent).

  • يُجسّد TasteVal الذوق التجريبي من خلال كفاءة الحوسبة، ويعرّفه كمضاعف لحوسبة التجارب مقارنة بالخبراء البشر.
  • تقارن التقييم أداء النماذج مع خط أساس تم إنشاؤه بواسطة 24 خبيراً بشرياً مُستقطباً عبر المهام.
  • برز Opus 5.5 كنموذج الأعلى أداءً، متجاوزاً خط الأساس للخبراء بمضاعف حوسبة يبلغ 2.3x تقريباً عند تكلفة تعادل حوالي 1/30 من متوسط تكاليف المشاركين في الخط الأساسي.
  • تشير البيانات إلى أن مضاعف الحوسبة للنماذج المتطورة تضاعف كل 3.0 أشهر تقريباً منذ ديسمبر 2025، متسارعاً من المعدل السابق الذي كان كل 14 شهراً.

يُسلط المعيار الضوء على تسارع كبير في مكاسب كفاءة الذكاء الاصطناعي، مما يشير إلى أن الذوق التجريبي أصبح عاملاً حاسماً في التنبؤ بالتقدم المستقبلي للذكاء الاصطناعي.