Los investigadores presentan Mid-Harness, un método que muestrea y verifica acciones candidatas en el límite entre el modelo y el arnés para mejorar la fiabilidad de la ejecución en agentes terminales. Este enfoque asigna cómputo en tiempo de prueba verificando múltiples opciones antes de enviar una para su ejecución, manteniendo inalterados el generador y el arnés.
- En TerminalBench-Lite, usar un verificador GPT-5.6 Sol con 8 acciones muestreadas eleva Pass@1 del 50.00% al 68.03% en comparación con el agente base.
- Cuando TMAX-9B actúa como verificador, la verificación por pares produce los mejores resultados entre los mecanismos evaluados.
- Destilar respuestas de un verificador más potente en TMAX-9B mejora aún más Pass@1 sin cambiar el generador de acciones.
- Combinar el escalado de acciones y trayectorias con TMAX-9B logra una mayor tasa de éxito a un costo estimado de tokens menor que generar más trayectorias por sí solo.
Estos hallazgos identifican el escalado de acciones como un objetivo prometedor para el escalado del cómputo en tiempo de prueba en agentes terminales, mejorando el rendimiento en modelos adicionales, benchmarks y arneses.