연구자들은 Mid-Harness를 소개합니다. 이 방법은 모델-하니스 경계에서 후보 액션을 샘플링하고 검증하여 터미널 에이전트의 실행 신뢰성을 높입니다. 이 접근 방식은 하나를 실행으로 전달하기 전에 여러 옵션을 검증함으로써 테스트 타임 컴퓨팅을 할당하며, 생성기와 하니스는 변경하지 않습니다.
- TerminalBench-Lite에서 8개의 샘플링된 액션을 사용하는 GPT-5.6 Sol 검증기를 적용하면 기본 에이전트 대비 Pass@1이 50.00%에서 68.03%로 향상됩니다.
- TMAX-9B가 검증기로 사용될 때, 쌍별 검증은 평가된 메커니즘 중 가장 우수한 결과를 보입니다.
- 더 강력한 검증기로부터의 응답을 TMAX-9B에 증류하면 액션 생성기를 변경하지 않고도 Pass@1을 추가로 향상시킵니다.
- TMAX-9B와 함께 액션 스케일링과 궤적 스케일링을 결합하면, 단순히 더 많은 궤적을 생성하는 것보다 더 낮은 추정 토큰 비용으로 더 높은 성공률을 달성합니다.
이러한 발견들은 터미널 에이전트에서의 테스트 타임 컴퓨팅 스케일링을 위해 액션 스케일링이 유망한 대상임을 식별하며, 추가 모델, 벤치마크 및 하니스 전반에 걸쳐 성능을 향상시킵니다.