Исследователи представляют TaoLive, технический отчёт о тренировке цифровых аватар-агентов, способных адаптироваться к изменяющимся бизнес-стратегиям в режиме реального времени на живых коммерческих трансляциях без повторного обучения. Система использует эволюционирующий Harness для разделения навыков и инструментов от весов модели, решая проблему запоминания устаревших конфигураций моделями с помощью обучения с учётом Harness (HAT).
- HAT применяет Augmentation состояния Harness на трёх этапах: контролируемая тонкая настройка, общая дистилляция on-policy и агентное обучение с подкреплением.
- Компактная модель 35B набирает 94.8 на Live-Stream QA и 94.6 на Harness-Variant QA, превосходя базовую модель (80.3) и сильнейшую общую LLM (93.0).
- Система достигает задержки P50 3.407 с и P95 8.114 с на одном GPU NVIDIA H20 с включённым MTP.
Этот подход создаёт компактного агента с приемлемой задержкой, который остаётся эффективным при оцениваемых изменениях Harness без ущерба для общего следования инструкциям.