연구자들은 재학습 없이 실시간 라이브 커머스에서 변화하는 비즈니스 전략에 적응할 수 있는 디지털 아바타 에이전트 학습에 관한 기술 보고서인 TaoLive를 제시했습니다. 이 시스템은 모델 가중치에서 스킬과 도구를 분리하기 위해 진화 가능한 Harness를 사용하며, 하니스 인식 학습(HAT)을 통해 모델이 오래된 구성을 암기하는 문제를 해결합니다.
- HAT는 세 단계에 걸쳐 하니스 상태 증강을 적용합니다: 지도 미세 조정, 일반 온-policy 증류, 그리고 에이전트 강화 학습.
- 컴팩트한 35B 모델은 Live-Stream QA에서 94.8점, Harness-Variant QA에서 94.6점을 기록하여 기본 모델(80.3)과 가장 강력한 일반 LLM(93.0)을 능가합니다.
- MTP 활성화 상태에서 단일 NVIDIA H20 GPU에서 3.407 s P50 및 8.114 s P95 지연 시간을 달성했습니다.
이 접근 방식은 일반적인 지시 따르기를 희생하지 않으면서 평가된 하니스 변경 상황에서도 효과적으로 작동하는 지연 시간 허용 가능한 컴팩트 에이전트를 생성합니다.