研究人员发布了 TaoLive,这是一份技术报告,介绍如何训练能够在实时直播电商中适应不断变化的商业策略的数字虚拟人智能体,而无需重新训练。该系统使用可演化的 Harness 将技能和工具与模型权重解耦,通过感知 Harness 的训练(HAT)解决模型记忆过时配置的挑战。

  • HAT 在三个阶段采用 Harness 状态增强:监督微调、通用在线策略蒸馏和代理强化学习。
  • 紧凑的 35B 模型在 Live-Stream QA 上得分 94.8,在 Harness-Variant QA 上得分 94.6,优于基础模型(80.3)和最强的通用 LLM(93.0)。
  • 该系统在启用 MTP 的单张 NVIDIA H20 GPU 上实现了 3.407 秒的 P50 延迟和 8.114 秒的 P95 延迟。

这种方法产生了一个延迟可行的紧凑智能体,在评估的 Harness 变化下保持有效,且不牺牲通用指令遵循能力。