Исследователи представляют Mid-Harness — метод, который выбирает и проверяет кандидаты на действия на границе между моделью и оболочкой (harness), чтобы повысить надёжность выполнения в терминальных агентах. Этот подход распределяет вычисления во время тестирования за счёт проверки нескольких вариантов перед отправкой одного из них на выполнение, оставляя генератор и оболочку без изменений.
- На TerminalBench-Lite использование верификатора GPT-5.6 Sol с 8 выборками действий повышает Pass@1 с 50.00% до 68.03% по сравнению с базовым агентом.
- Когда TMAX-9B выступает в роли верификатора, парная верификация даёт лучшие результаты среди оценённых механизмов.
- Дистилляция ответов от более сильного верификатора в TMAX-9B дополнительно повышает Pass@1 без изменения генератора действий.
- Комбинация масштабирования действий и траекторий с TMAX-9B обеспечивает более высокий успех при меньшей оценке стоимости токенов, чем просто генерация большего числа траекторий.
Эти результаты показывают, что масштабирование действий является перспективным направлением для масштабирования вычислений во время тестирования в терминальных агентах, улучшая производительность на дополнительных моделях, бенчмарках и оболочках.