Les chercheurs présentent TaoLive, un rapport technique sur l'entraînement d'agents avatars numériques capables de s'adapter en temps réel aux stratégies commerciales changeantes dans le e-commerce en direct, sans nécessiter de réentraînement. Le système utilise un harnais évolutif pour découpler les compétences et les outils des poids du modèle, répondant ainsi au défi de la mémorisation par les modèles de configurations obsolètes grâce à l'entraînement conscient du harnais (HAT).
- HAT emploie l'augmentation de l'état du harnais sur trois étapes : le réglage fin supervisé, la distillation générale en ligne et l'apprentissage par renforcement agentique.
- Le modèle compact de 35B obtient un score de 94.8 sur Live-Stream QA et de 94.6 sur Harness-Variant QA, surpassant le modèle de base (80.3) et le LLM général le plus performant (93.0).
- Le système atteint une latence P50 de 3,407 s et P95 de 8,114 s sur un seul GPU NVIDIA H20 avec MTP activé.
Cette approche produit un agent compact dont la latence est réalisable, qui reste efficace face aux modifications du harnais évaluées sans sacrifier le respect général des instructions.