Los investigadores presentan TaoLive, un informe técnico sobre el entrenamiento de agentes de avatar digital que pueden adaptarse a estrategias comerciales cambiantes en tiempo real durante el comercio electrónico en vivo sin necesidad de reentrenamiento. El sistema utiliza un Arnés Evolutivo para desacoplar habilidades y herramientas de los pesos del modelo, abordando el desafío de que los modelos memoricen configuraciones desactualizadas mediante Entrenamiento Consciente del Arnés (HAT).
- HAT emplea Aumento de Estado del Arnés en tres etapas: ajuste fino supervisado, destilación general on-policy y aprendizaje por refuerzo agéntico.
- El modelo compacto de 35B obtiene una puntuación de 94.8 en Live-Stream QA y 94.6 en Harness-Variant QA, superando al modelo base (80.3) y al LLM general más potente (93.0).
- El sistema logra una latencia P50 de 3.407 s y P95 de 8.114 s en una única GPU NVIDIA H20 con MTP habilitado.
Este enfoque produce un agente compacto viable en términos de latencia que permanece efectivo ante los cambios de Arnés evaluados sin sacrificar el seguimiento general de instrucciones.