跳转到正文
分享一个业务流程。DRING 两分钟内给您回电,梳理具体需求。 两分钟内接到回电
2 分钟内接到回电 查看 Agent Factory
质量

接电话之前,先过测试

您不用写一句提示词。我们收集材料,据此构建测试,只发布通过测试的版本。

DRING 测试集

测试来自您自己的材料

写提示词不是您的工作。设想智能体会碰到哪些难缠的电话,也不是。

您不用写一句提示词

您的团队讲清工作内容,并审阅智能体说的话。提示词本身由我们来写、来维护。

测试基于我们收集的材料

文档、通话录音、政策,以及您在审阅时留下的意见,都会成为该智能体的测试集。

经 DRING 批准,再上线

智能体只有通过这套测试集,才会进入生产环境。在那之前,它只在专用线路上运行。

接第一通真实电话之前,先跑 1,000 至 10,000 次专为您企业生成的模拟对话。模拟对话的数量取决于智能体,每一次都根据您自己的业务流程、文档和通话录音生成,而不是一套通用的基准测试集。

改动也遵循同样的纪律。您给我们的每条规则都会加入该智能体唯一的测试集,只有在所有已有规则同时通过时,新规则才会上线。看看智能体如何搭建

上线之前

智能体上线前要经历什么

每个智能体都走同一套流程,无论业务场景从外面看起来多简单。

  1. 来自您真实业务的客户画像

    愤怒的来电者、下错的订单、政策陷阱、沉默和插话,都取自您自己的业务流程。

  2. 模拟对话

    每个客户画像都和智能体完整走一遍对话,而不是只问一个事先写好的问题。

  3. 独立评估

    自动评估器为每段对话打分。评估结果不一致时,由人工审核这通电话。

  4. 回归检查

    任何版本发布前,结果都会与上一个版本对比,修好一处不会悄悄弄坏另一处。

  5. 检查转人工路径

    转给人工的升级路径会被明确验证,而不是默认它能用。

  6. 分阶段上线

    真实流量分阶段逐步增加,每一步都盯着评分,上一个版本随时待命。

自动评估可能出现偏差,也可能漏掉细微之处。独立检查,加上对每次分歧的人工复核,让这个信号比单一分数更有参考价值。

上线之后

质量管控一直在运行

测试不会在上线时停止。只要智能体在运行,就会定期接受质量管控。

每通电话都有评分

通话一结束,解决情况、政策遵循度和响应时间即完成评分,情绪同时打上标签。

定期全面复测

每个在线智能体都会定期与上一个版本对比重跑,赶在客户察觉之前发现悄悄出现的退步。

质量下滑告警

某项评分一旦超出预期范围,就会自动告警,不必等下一次复测。

语音识别错误追踪

语音转文字的错误按人名、地名和产品术语追踪,然后在智能体的词典中修正。

指标定义为什么重要
解决率客户来电的原因是否真正得到了处理。衡量智能体是否完成本职工作的核心指标。
情绪客户的语气从通话开始到结束发生了怎样的变化。揪出那些账面上已解决、客户却很不满的通话。
政策遵循度智能体的操作是否始终在为它配置的规则之内。让智能体守在企业设定的边界之内。
响应时间从客户说完话到智能体回应之间的间隔。回应慢了,即使答案正确,听起来也像信号不好。
转人工准确度该转人工的时候,智能体有没有转。漏掉一次该有的升级,比多一次不必要的升级更糟。
回归差值在同一测试集上,相对上一个版本的分数变化。揪出那些悄悄让智能体变差的版本。
外呼 A/B 测试

更好的开场白,靠结果而不是意见胜出

哪句开场白、哪种语气、哪个声音效果好,要在真实的外呼电话里见分晓,而不是在会议室里拍板。

示意测试 · 开场白变体第 1 阶段 · 平均分配流量
变体 A“您好,我是物流团队的,想跟您聊一下您提交的发货需求。”
流量33%
绿色结果0%
0 通电话
变体 B“您好,您上个月找我们要过一份货运报价。现在方便问您两个问题吗?”
流量33%
绿色结果0%
0 通电话
变体 C“下午好,简单跟您说一下国际运费的情况,不会耽误您太久。”
流量34%
绿色结果0%
0 通电话
尚未达到最低样本量,继续分流。

测试什么

开场白、语气、声音、语速、提问顺序,以及应对异议的方式。每个变体只改一个变量,结果才能归因。

如何选出胜者

依据外呼任务自己的结果,每个变体都要达到约定的最低样本量。情绪和转人工率是护栏:结果上赢了、客户观感却输了的变体,不会上线。

如何上线

胜出的变体分阶段推广,其他变体下线,改动留有记录,下一次对比从一个已知的基线出发。

推广前,胜出的变体仍要先通过回归测试集,才会覆盖整个外呼任务。

安全护栏

智能体绝不会做的事

  • 超出范围的请求,它会拒绝超出智能体设计职责的请求会被婉拒,而不是临场发挥。
  • 它从不编造政策没有给它的规则,它不会去猜,也不会替您做承诺。
  • 敏感话题,它会升级敏感请求交给人来处理,而不是由智能体自行判断。
  • 它始终提供人工选项无论智能体自己能做多少,来电者都随时可以转人工。
常见问题

关于测试的问题

我们需要自己写或维护提示词吗?+

不需要。您讲清工作内容,提供文档和通话录音,并审阅智能体说的话。提示词的编写和维护是我们的工作,测试也是根据您提供的材料构建的,而不是套用通用模板。

每次发布前都会测试,而不只是首次上线吗?+

是的。回归复测会定期与上一个版本对比运行,每一次改动都和首次上线一样分阶段推出。

两次评估结果不一致时怎么办?+

这段对话会转给人工复核员,审核之后才确定结果。反复出现分歧,说明评估集本身需要完善。

我们能看到自己智能体的测试场景吗?+

能。客户画像和场景都围绕您自己的政策和边缘情况构建,上线实施期间您都能看到。

在线智能体的评分出现下滑怎么办?+

系统会自动发出质量下滑告警,相关通话会被复核,修复后先重新通过测试集,这类来电才会再交回给智能体。

查看完整常见问题

用您自己的业务场景看看测试集

一起走一遍可衡量的上线是什么样子:从第一份业务流程简报,到上线后的复盘循环。