研究者らは、モデルとハーネスの境界で候補アクションをサンプリングして検証し、ターミナルエージェントの実行信頼性を向上させる手法であるMid-Harnessを発表した。このアプローチは、実行のために1つのアクションを送信する前に複数のオプションを検証することでテスト時の計算量を割り当て、ジェネレーターとハーネスの変更は行わない。
- TerminalBench-Liteにおいて、8つのサンプリングされたアクションを使用するGPT-5.6 Sol検証者は、ベースエージェントと比較してPass@1を50.00%から68.03%に向上させる。
- TMAX-9Bが検証者として機能する場合、ペアワイズ検証は評価されたメカニズムの中で最も良い結果をもたらす。
- より強力な検証者からの応答をTMAX-9Bに蒸留することで、アクションジェネレーターを変更せずにPass@1をさらに向上させることができる。
- TMAX-9Bとアクションおよびトラジェクトリスケーリングを組み合わせることで、単にトラジェクトリを増やすよりも低い推定トークンコストでより高い成功率を実現する。
これらの知見は、ターミナルエージェントにおけるテスト時の計算量スケーリングの有望な対象としてアクションスケーリングを特定し、追加のモデル、ベンチマーク、ハーネス全体でパフォーマンスを向上させる。