Исследователи внедрили «руководства по согласованности» в систему ALTK-Evolve — новый механизм, предназначенный для устранения вариативности производительности LLM-агентов, которую часто скрывают стандартные метрики средней точности. Выявляя и стабилизируя точки принятия решений, склонные к изменению результатов, этот подход значительно повышает стабильность выполнения задач без ущерба для общей способности.
- Анализатор согласованности обнаруживает «склонные к изменению» шаги путём повторной выборки одной записанной траектории с k=5 завершениями, не требуя эталонных ответов или сквозных перезапусков.
- На тесте AppWorld test_normal с агентом ReAct, использующим GPT-4.1, руководства по согласованности сократили разрыв согласованности (Mean@5 минус Pass^5) с 24,4 процентных пункта до 12,0 процентных пунктов.
- Совокупный показатель Pass^5 вырос с 53,0% до 69,0%, в то время как Mean@5 незначительно увеличился с 77,4% до 81,0%, сохранив среднюю точность.
- Метод обобщается на аналогичные задачи, повышая Pass^5 на 13,0 процентных пунктов, и демонстрирует переносимые улучшения на более слабых моделях, таких как gpt-oss-120b.
Эта работа подчёркивает, что согласованность является ортогональной осью по отношению к способности, призывая разработчиков сообщать Pass^k вместе с Mean@k для более точной оценки надёжности агентов в производственных средах.