本文提出HAT训练法,用于解决直播数字人Agent在低延迟下适应业务规则频繁变化的问题。该方法将动态执行环境Harness状态纳入训练分布,分三阶段:HSA-SFT提升工具调用能力,通用指令蒸馏恢复通用能力,HSA-RL在仿真环境学习真实交互。基于Qwen3.6-35B-A3B的模型在直播问答达94.8分,超越千亿参数大模型,Harness变化下保持94.6分,端到端延迟P50仅3.407秒,已落地淘宝直播数字人业务。
完成下面两步后,将自动完成登录并继续当前操作。