📰 淘宝直播数字人互动Harness-Aware Training实践:让Agent Model随Harness一起进化 - 53AI-AI知识库|企业AI知识库|大模型知识库|前线部署工程师|FDE|AIHub
本文提出 Harness-Aware Training (HAT) 方法,针对直播电商数字人 Agent 在低延迟要求下需应对频繁变动的业务规则和 Harness 配置问题,提供一种以 Harness 状态为显式训练分布的三阶段训练流程。第一阶段 HSA-SFT 让小模型在多样化 Harness 条件下学习强模型产生的高质量轨迹,提升工具调用与推理能力;第二阶段 General OPD 通过 On-Policy 指令蒸馏,恢复领域训练中易损失的通用指令遵循能力;第三阶段 HSA-RL 在增强 Harness 的仿真环境中通过多轮交互、工具调用与失败恢复轨迹,增强模型对 Harness 的真实理解。实验结果显示,基于 Qwen3.6-35B-A3B 的模型在 Live-Stream QA 达到 94.8 分、Harness-Variant QA 达到 94.6 分,端到端延迟在单张 NVIDIA H20 上的 P50 为 3.407 秒,P95 为 8.114 秒,且在 Harness 进化场景保持鲁棒性,同时保持对通用指令遵循的能力。HAT 已落地淘宝直播数字人业务,系统通过三阶段协同提升实现低延迟与快速迭代的平衡,并通过 MTP(多 token 预测)实现推理加速,部署延迟显著优于传统大模型方案。该方法能够在不重新训练模型权重的前提下,通过对 Harness、Skills、Hooks、Tools 的迭代更新实现快速适配新的 Harness 进化。总结而言,HAT 提供了一条在动态运行环境中兼顾性能、鲁棒性与延迟的新路径,具备真实应用价值与扩展潜力。
🏷️ #HAT #HarnessEvo #低延迟 #数字人 #直播电商
🔗 原文链接
📰 淘宝直播数字人互动Harness-Aware Training实践:让Agent Model随Harness一起进化 - 53AI-AI知识库|企业AI知识库|大模型知识库|前线部署工程师|FDE|AIHub
本文提出 Harness-Aware Training (HAT) 方法,针对直播电商数字人 Agent 在低延迟要求下需应对频繁变动的业务规则和 Harness 配置问题,提供一种以 Harness 状态为显式训练分布的三阶段训练流程。第一阶段 HSA-SFT 让小模型在多样化 Harness 条件下学习强模型产生的高质量轨迹,提升工具调用与推理能力;第二阶段 General OPD 通过 On-Policy 指令蒸馏,恢复领域训练中易损失的通用指令遵循能力;第三阶段 HSA-RL 在增强 Harness 的仿真环境中通过多轮交互、工具调用与失败恢复轨迹,增强模型对 Harness 的真实理解。实验结果显示,基于 Qwen3.6-35B-A3B 的模型在 Live-Stream QA 达到 94.8 分、Harness-Variant QA 达到 94.6 分,端到端延迟在单张 NVIDIA H20 上的 P50 为 3.407 秒,P95 为 8.114 秒,且在 Harness 进化场景保持鲁棒性,同时保持对通用指令遵循的能力。HAT 已落地淘宝直播数字人业务,系统通过三阶段协同提升实现低延迟与快速迭代的平衡,并通过 MTP(多 token 预测)实现推理加速,部署延迟显著优于传统大模型方案。该方法能够在不重新训练模型权重的前提下,通过对 Harness、Skills、Hooks、Tools 的迭代更新实现快速适配新的 Harness 进化。总结而言,HAT 提供了一条在动态运行环境中兼顾性能、鲁棒性与延迟的新路径,具备真实应用价值与扩展潜力。
🏷️ #HAT #HarnessEvo #低延迟 #数字人 #直播电商
🔗 原文链接