Pesquisadores apresentam o TasteVal, um benchmark projetado para avaliar o gosto para pesquisa experimental de modelos de IA de ponta, medindo sua capacidade de projetar experimentos e interpretar resultados com eficiência. O estudo avalia 20 modelos lançados entre 2023 e 2026 usando oito tarefas novas, nas quais um agente Researcher projeta experimentos de forma iterativa enquanto um agente Coder fixo os implementa.
- TasteVal operacionaliza o gosto experimental como eficiência computacional, definindo-o como o multiplicador do compute experimental em relação a especialistas humanos.
- A avaliação compara o desempenho dos modelos contra uma linha de base estabelecida por 24 especialistas humanos recrutados nas tarefas.
- O Opus 5.5 surgiu como o modelo com melhor desempenho, superando a linha de base de especialistas com um multiplicador de compute de 2,3x, custando aproximadamente 1/30 do custo médio dos baseliners.
- Os dados indicam que o multiplicador de compute para modelos de ponta dobrou aproximadamente a cada 3,0 meses desde dezembro de 2025, acelerando em relação à taxa anterior de a cada 14 meses.
O benchmark destaca uma aceleração significativa nos ganhos de eficiência da IA, sugerindo que o gosto experimental está se tornando um fator crítico para prever o progresso futuro da IA.