Microsoft и Hugging Face выпустили ThinkingBox, бенчмарк, который оценивает ИИ-агентов по их влиянию на изолированные состояния баз данных, а не только по вызовам инструментов или финальным ответам. В ходе исследования 507 состоящих из нескольких шагов бизнес-процессов, запущенных по 20 раз каждый против различных моделей LLM, было обнаружено, что, хотя многие агенты генерируют корректные вызовы инструментов, они часто оставляют неверные значения, непреднамеренные дополнительные эффекты или отсутствие требуемых эффектов в бэкенде.
- Claude Opus 5.5 лидирует в целом с показателем pass@1 67.16%, но лишь три модели сохраняют большую часть своих результатов при первой попытке на протяжении 20 повторений: GPT-6 Astra (78%), Claude Opus 5.5 (71%) и Claude Opus 5 (71%).
- Kimi-K3 решает самый широкий охват задач (93.89% хотя бы один раз), но является одной из наименее последовательных, успешно справляясь со всеми 20 попытками только для 13.41% задач.
- GPT-5.6 Sol предлагает самую низкую стоимость на успешную попытку задачи в размере $0.127, тогда как GPT-5.4 является самым дешёвым надёжным вариантом при стоимости $6.80 за задачу, пройденную во всех 20 попытках.
Примерно четыре из пяти сбоев связаны с проблемами обработки инструментов, такими как неспособность восстановиться после ошибок или пустых запросов, а не с дефицитом рассуждений.
Авторы утверждают, что одних лишь показателей pass@1 недостаточно для надёжного развёртывания и рекомендуют использовать уровень согласованности 20/20 в качестве входного параметра проектирования, проверяя состояние терминала перед внесением изменений в продакшене.