Los investigadores presentan TasteVal, un benchmark diseñado para evaluar el gusto en investigación experimental de modelos de IA de vanguardia midiendo su capacidad para diseñar experimentos e interpretar resultados de manera eficiente. El estudio evalúa 20 modelos lanzados entre 2023 y 2026 utilizando ocho tareas novedosas donde un agente Researcher diseña iterativamente experimentos mientras un agente Coder fijo los implementa.

  • TasteVal operacionaliza el gusto experimental como eficiencia computacional, definiéndolo como el multiplicador del cómputo experimental relativo a expertos humanos.
  • La evaluación compara el rendimiento de los modelos contra una línea base establecida por 24 expertos humanos reclutados en las tareas.
  • Opus 5.5 surgió como el modelo con mejor rendimiento, superando la línea base de expertos con un multiplicador de cómputo de 2.3x a aproximadamente 1/30 del costo promedio de los comparadores.
  • Los datos indican que el multiplicador de cómputo para modelos de vanguardia se ha duplicado aproximadamente cada 3.0 meses desde diciembre de 2025, acelerándose respecto al ritmo anterior de cada 14 meses.

El benchmark destaca una aceleración significativa en las ganancias de eficiencia de la IA, sugiriendo que el gusto experimental está convirtiéndose en un factor crítico para pronosticar el futuro progreso de la IA.