论文推荐|TaoLive提出Harness感知训练:35B数字人直播代理实时适应可变接口,P50延迟仅3.4秒
thinkindev • 2026-08-21
1131 views
TaoLive团队针对直播电商数字人代理的实时性与适应性矛盾,提出Harness-Aware Training(HAT)后训练方法。其核心是将技能、钩子、系统提示和工具模式从模型权重中解耦,使运行时行为可随业务策略变化而无需重新训练。但Harness不断演化会让微调模型容易记住旧名称、schema和提示模板,而强零样本模型又难以满足实时延迟。为此,HAT在监督微调、通用能力蒸馏和智能体强化学习三阶段中引入任务保持的Harness状态增强,让35B紧凑模型学会根据当前Harness推理而非记忆固定接口。在超4500个评测样本中,该模型在真实直播问答上取得94.8分,优于基础模型的80.3分和最强通用大模型的93.0分,并在Harness变体问答上保持94.6分,同时IFEval通用指令遵循得分保留83.5。单张NVIDIA H20 GPU下系统P50延迟为3.407秒,P95为8.114秒。研究显示该方法可在不牺牲通用能力的前提下,训练出延迟可行的紧凑型直播代理。不过评测由厂商主导且聚焦直播电商,其跨领域泛化性仍需进一步验证。
核心要点
- HAT通过Harness状态增强让35B模型跟随当前接口而非记忆固定配置
- 在直播问答和Harness变体测试中分别达到94.8和94.6分,优于更强通用模型
- 单卡H20推理P50延迟3.407秒,兼顾实时性与通用指令跟随能力