Les chercheurs présentent TasteVal, un benchmark conçu pour évaluer le goût expérimental en recherche des modèles d'IA de pointe en mesurant leur capacité à concevoir des expériences et à interpréter les résultats efficacement. L'étude évalue 20 modèles publiés entre 2023 et 2026 à l'aide de huit tâches novatrices où un agent Chercheur conçoit itérativement des expériences tandis qu'un agent Codeur fixe les implémente.
- TasteVal opérationnalise le goût expérimental comme une efficacité de calcul, le définissant comme le multiplicateur du calcul expérimental par rapport aux experts humains.
- L'évaluation compare les performances des modèles à une ligne de base établie par 24 experts humains recrutés sur l'ensemble des tâches.
- Opus 5.5 s'est imposé comme le modèle le plus performant, dépassant la ligne de base des experts avec un multiplicateur de calcul de 2,3x pour environ 1/30e du coût moyen des comparateurs.
- Les données indiquent que le multiplicateur de calcul pour les modèles de pointe a doublé approximativement tous les 3,0 mois depuis décembre 2025, s'accélérant par rapport au rythme précédent de tous les 14 mois.
Le benchmark met en évidence une accélération significative des gains d'efficacité de l'IA, suggérant que le goût expérimental devient un facteur critique dans la prévision des progrès futurs de l'IA.