Pesquisadores apresentam o TaoLive, um relatório técnico sobre o treinamento de agentes de avatar digital que podem se adaptar a estratégias de negócios em mudança em tempo real no comércio eletrônico ao vivo, sem necessidade de retreinamento. O sistema utiliza um Harness evolutivo para desacoplar habilidades e ferramentas dos pesos do modelo, abordando o desafio de os modelos memorizarem configurações desatualizadas por meio do Treinamento Consciente do Harness (HAT).
- O HAT emprega Aumento de Estado do Harness em três etapas: ajuste fino supervisionado, destilação on-policy geral e aprendizado por reforço agêntico.
- O modelo compacto de 35B obtém pontuação de 94,8 no Live-Stream QA e 94,6 no Harness-Variant QA, superando o modelo base (80,3) e o LLM geral mais forte (93,0).
- O sistema alcança latência P50 de 3,407 s e P95 de 8,114 s em uma única GPU NVIDIA H20 com MTP habilitado.
Essa abordagem produz um agente compacto viável em termos de latência que permanece eficaz sob as mudanças de Harness avaliadas, sem sacrificar o seguimento geral de instruções.