位置:首页 > 技术资讯 > 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴

时间:2026-07-18  |  作者:游戏探长  |  阅读:0

智能客服系统正经历一场深刻的变革。它从仅能处理简单问答的“机械应答”,逐步升级为能够理解复杂意图、进行多轮协商并展现情感温度的“服务伙伴”。得物技术团队在此次升级中,分享了其高可控性Agent工程的核心实践。该实践重点解决了智能客服在落地过程中面临的场景复杂、成本高昂与拟人化不足等关键挑战。

一、智能客服当下的痛点

在深入Agent工程实践之前,需要明确当前智能客服系统普遍存在的三大核心痛点:

  • 听不懂人话、自作聪明:无法准确理解用户意图,频繁答非所问,导致用户体验差。
  • 成本高、排队严重:高并发场景下,人力客服无法覆盖所有用户,导致用户长时间排队等待。
  • 问题解决能力弱:只能处理简单FAQ,面对复杂、涉及多轮交互的问题时,常常无能为力。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

二、智能客服 Agent 落地的必然性与挑战

Agent 智能客服的必然性

传统的“意图分类 + NER + 对话管理 + FAQ 召回 + 重排”的流水线架构,存在明显局限:

  • 传统结构存在上限:无法处理多步骤任务,上下文衔接不畅,无法进行复杂的多轮对话。
  • SOP 人工维护成本高:场景中的问法无法穷举,导致标准操作流程(SOP)的维护成本极高。
  • 多模型运维成本高:多套小模型分头部署,牵一发而动全身,运维成本极高。
  • 会话拟人度 / 流畅度不佳:出话单一,无法复刻优秀人工客服的决策和话术能力。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

Agent 智能客服的挑战

在向Agent架构演进的过程中,也面临新的挑战:

  • 场景复杂指令优化成本高:场景复杂、知识流程繁琐,针对长尾案例的提示工程(PE)优化成本高昂。
  • 长 Context 多轮能力不足:结合用户多样性需求和长历史上下文的多轮决策/协商,对模型能力要求极高,挑战较大。
  • 对齐人工拟人化能力不足:人工回复多样性高,昵称、话术、表情、模态运用灵活,需要“人工辅助Agent”进行对齐。
  • 多轮半双工下消息控制:模型推理时长较长,在半双工环境下,消息打断、上下文话题切换的控制难度较大。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

三、客服 Agent 多轮协商优化(高可控性 PE 自动化)

单场景架构演进

第一阶段:Single-Agent(单 Prompt)

最初基于Qwen的Single-Agent架构,存在两个主要问题:

  • Prompt过长,模型指令遵循能力有限。
  • 串行Pipeline无法实现Agent的多轮ReAct(思考-行动)模式。

第二阶段:Multi-Agent(渐进式披露)

为解决上述问题,团队采用了AutoGen的Multi-Agent架构,引入多个专用Agent:

  • 总控 Agent:负责任务调度与流程管控。
  • 出话 Agent:负责生成最终回复话术。
  • 评估器 Agent:对输出质量进行实时评估。
  • 润色 Agent:提升回复的自然度和拟人感。

通过`SelectorGroupChat`模式实现动态调度,解决率提升明显

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

跨场景 Harness 架构

为解决跨场景复用问题,进一步演进至Harness 架构。其核心能力包括:

  • 跨会话 Memory:支持用户历史上下文记忆。
  • 上下文压缩与轨迹压缩:有效管理长对话,节省Token成本。
  • 总控 Agent 管理:提高回复的可控性。
  • 数据飞轮驱动模型持续优化
  • Skill 自动化生成(正在推进中)。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

数据飞轮:PE 自动化与模型训练

PE 自动化优化

人工Prompt Engineering存在明显痛点:时间成本高、多个case引发Prompt冲突与歧义、Token成本和指令遵循能力有限。为此,团队构建了PE自动化流水线

  1. 对比数据抽取:LLM抽取转人工case中Agent回复(Bad)和人工回复(Good)作为对比样本。
  2. PE 修改建议:LLM分析Prompt存在的问题,并提出修改建议。
  3. 人工 Review:人工标注并检查修改建议是否可行。
  4. 离线跑测:合并修改建议,跑测同批数据,验证效果。
  5. 上线实验:积累数据,持续优化Prompt。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

效果验证:

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

数据飞轮-模型训练

通过DPO 模型训练飞轮,利用“LLM-as-a-Judge”搜集回流数据并重新训练:

  • 训练能否回复判别模型、回复正确性模型、是否拟人判别模型。
  • 构造chosen(优选)和reject(拒绝)样本。
  • 训练专门的润色模型。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

四、RL 决策训练:让 Agent 学会"正确决策"

训练框架

RL训练框架主要分为三大模块:

数据基建

  • 采集线上反馈数据,通过策略埋点构造Multi-turn RL训练数据。
  • 利用专家模型生成决策理由,进行CoT-RL(思维链)训练。
  • 部署MCP Server,实现实时Tools调用。

模型训练

  • Cold-start SFT 预热:通过监督微调为强化学习提供良好的初始策略。
  • 可验证奖励:使用Rule-Based-Reward(基于规则的奖励)对模型行为进行约束。
  • 生成式奖励:使用Model-Based-Reward(基于模型的奖励)评估模型输出的质量。
  • GRPO 训练:采用GRPO(Group Relative Policy Optimization)算法进行训练。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

评测体系

  • LLM-as-a-Judge(大模型作为裁判)。
  • 人工评测。
  • 用户模拟器一致性评测。

对抗 Reward Hacking

  • 优化Reward函数,避免模型钻空子。
  • 解决数据有偏问题,确保训练数据代表性。
  • 增加思考过程,即CoT训练,让模型学会推理。

训练效果对比

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

实验

消融实验

  • 不同epoch(训练轮次)对比。
  • 不同cold-start sft底座对比。
  • 不同lr(学习率)对比。

业务干扰度消融实验

  • A业务。
  • B业务。
  • A业务 + B业务(混合训练效果)。

RL 训练减少灾难性遗忘

测试标准:C-Eval、CMMLU。

规避方法:

  • 降低学习率(全量训练 ≤ 5e-5)。
  • 通过eval-step实时监控通用基准指标。
  • 限制训练2~4 epoch。
  • 控制数据比例:模型自推理 VS 模型依赖Tool调用 = 1:1。
得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

五、情感温度:人类经验对齐模型蒸馏

服务测评标准

为了量化模型的服务质量,团队建立了完整的百分制测评体系:

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

模型蒸馏训练

三种训练模式协同工作:

  • CoT-RL 策略蒸馏:蒸馏优秀客服的决策逻辑,让模型学会“像优秀客服一样思考”。
  • DPO 话术蒸馏:对齐对话语气、减少重复、规范表情包和称谓的使用。
  • 表情模块:通过表情分类 + 语境分析,精细化控制表情使用时机,提升回复的生动性。

表情分类体系:开场欢迎 / 积极开心 / 思考疑惑 / 抱歉安抚 / 提醒强调 / 期待等待 / 完成确认 / 正在努力 / 物流配送 / 价格优惠 / 对接售后 / 结束感谢。

人工对齐效果

经过对齐训练,模型评分接近Top5%优秀人工水平,在情感表达和沟通技巧上取得了显著进步。

六、多轮消息流控制:半双工对话逻辑设计

消息收发模式

智能客服场景具有特殊性:用户可随时发送消息(全双工),但Agent在回复期间不应被打断(半双工)。因此,系统设计为:

  • 用户→Agent:全双工,用户可随时打断。
  • Agent→用户:半双工,Agent回复不可打断。

多消息处理策略

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com 得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

为了实现精准的消息合并/切分判断,团队训练了专门的分类模型:

  • 数据采集:拉取线上用户连续消息进行人工标注。
  • 数据增强:利用LLM对负样本进行扩写,增加数据多样性。
  • 模型训练:使用Qwen3-4B模型进行分类训练,判断用户连续发送的多条消息是应该合并处理还是切分处理。

七、总结与展望

本次实践总结

本次分享围绕以下核心技术展开:

  • 应对客服Agent挑战的架构设计(从Single-Agent演进到Multi-Agent,再到Harness架构)。
  • 构建高可控性数据飞轮(PE自动化与DPO训练)。
  • 通过RL策略训练和人工经验对齐,提升模型决策能力与情感温度。
  • 设计多轮半双工消息流控制机制,保障对话的流畅与稳定。

未来展望

得物高可控智能客服Agent工程实践:从机械应答到服务伙伴_wishdown.com

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多