연구자들은 최전선 AI 모델들의 실험 연구 취향을 평가하기 위해 설계된 TasteVal이라는 벤치마크를 소개했으며, 이는 모델들이 실험을 설계하고 결과를 해석하는 효율성을 측정함으로써 이루어졌다. 이 연구는 2023년부터 2026년 사이에 출시된 20개의 모델을 평가했으며, 여기에는 Researcher 에이전트가 반복적으로 실험을 설계하고 고정된 Coder 에이전트가 이를 구현하는 8가지 새로운 과제가 포함되었다.
- TasteVal은 계산 효율성을 실험적 취향으로 작동화하며, 이를 인간 전문가 대비 실험용 계산량의 배수로서 정의한다.
- 평가는 모델의 성능을 24명의 채용된 인간 전문가들이 과제에서 확립한 기준선과 비교한다.
- Opus 5.5가 가장 우수한 성능을 보인 모델로 부상했으며, 기준선 작성자들의 평균 비용의 약 1/30 수준에서 계산 배수 2.3배를 기록하며 전문가 기준선을 초과했다.
- 데이터에 따르면 최전선 모델들의 계산 배수는 2025년 12월 이후 약 3.0개월마다 두 배씩 증가했으며, 이는 이전의 14개월 주기에 비해 가속화된 것이다.
이 벤치마크는 AI 효율성 향상의 상당한 가속화를 강조하며, 실험적 취향이 향후 AI 진전을 예측하는 데 있어 중요한 요소가 되고 있음을 시사한다.