Исследователи представляют TasteVal, бенчмарк, разработанный для оценки экспериментального исследовательского вкуса передовых моделей ИИ путем измерения их способности эффективно разрабатывать эксперименты и интерпретировать результаты. В исследовании оцениваются 20 моделей, выпущенных в период с 2023 по 2026 год, с использованием восьми новых задач, где агент Researcher итеративно разрабатывает эксперименты, а фиксированный агент Coder реализует их.
- TasteVal операционализирует экспериментальный вкус как вычислительную эффективность, определяя его как множитель вычислений эксперимента относительно экспертов-людей.
- Оценка сравнивает производительность моделей с базовым уровнем, установленным 24 привлеченными экспертами-людьми по всем задачам.
- Opus 5.5 показал наилучшие результаты, превзойдя базовый уровень экспертов с вычислительным множителем 2.3x при стоимости, составляющей примерно 1/30 от средней стоимости участников базового уровня.
- Данные указывают на то, что вычислительный множитель для передовых моделей удваивался примерно каждые 3.0 месяца с декабря 2025 года, ускорившись по сравнению с предыдущей скоростью удвоения каждые 14 месяцев.
Бенчмарк подчеркивает значительное ускорение в приросте эффективности ИИ, предполагая, что экспериментальный вкус становится критическим фактором в прогнозировании будущего прогресса ИИ.