शोधकर्ताओं ने TaoLive प्रस्तुत किया, जो एक तकनीकी रिपोर्ट है उन डिजिटल-अवतार एजेंट्स के प्रशिक्षण पर जो बिना पुनः प्रशिक्षण के रियल-टाइम लाइव ई-कॉमर्स में बदलती व्यापरिक रणनीतियों के अनुकूल हो सकते हैं। सिस्टम एक विकसनीय Harness का उपयोग करता है जो कौशल और उपकरणों को मॉडल वजन से अलग करता है, जिससे पुरानी कॉन्फ़िगरेशन याद रखने की चुनौती का समाधान होता है Harness-Aware Training (HAT) के माध्यम से।
- HAT तीन चरणों में Harness-State Augmentation का उपयोग करता है: सुपरवाइज्ड फाइन-ट्यूनिंग, सामान्य ऑन-पॉलिसी डिस्टिलेशन, और एजेंटिक रीइन्फोर्समेंट लर्निंग।
- कॉम्पैक्ट 35B मॉडल Live-Stream QA पर 94.8 और Harness-Variant QA पर 94.6 स्कोर करता है, जो बेस मॉडल (80.3) और सबसे शक्तिशाली सामान्य LLM (93.0) को हराता है।
- सिस्टम MTP सक्षम होने पर एकल NVIDIA H20 GPU पर 3.407 s P50 और 8.114 s P95 लेटेंसी प्राप्त करता है।
यह दृष्टिकोण एक लेटेंसी-संभव कॉम्पैक्ट एजेंट उत्पन्न करता है जो मूल्यांकित Harness परिवर्तनों के तहत प्रभावी रहता है बिना सामान्य निर्देश अनुसरण को त्यागे।