跳转到正文
分享一个业务流程。DRING 两分钟内给您回电,梳理具体需求。 两分钟内接到回电
2 分钟内接到回电 查看 Agent Factory
上线指南 · 试点评估

如何评估 30 天语音 AI 试点

什么算成功,要在第一通真实电话之前定下来。本指南提供一张试点评估卡、一份每周复盘模板,以及第 30 天决定扩大、延长还是停止的规则。

先说结论

第 30 天,每项指标都达到目标值,而且没有越过任何止损线,语音 AI 试点才算成功。目标值和止损线都写在试点评估卡上,这张卡在第一通真实电话之前就已签字确认。如果标准是电话打完之后才定的,第 30 天就会变成一场争论:哪些电话该算,哪些不算。如果事先定好,第 30 天开个短会就够了。

先在可比的时期内,为同一来电类型测出基线。把五项指标放在同一张试点评估卡上:解决率、重复联系率、错误操作率、转接质量和人工投入。每项指标都要有精确定义、目标值和止损线,每周复盘都看同一张卡。

第 30 天,按事先约定的规则做决定。所有指标都达到目标值,就扩大。一两项指标未达标,并且能用一个已知原因解释,就延长一次,为期两周。越过任一止损线、三项或以上指标未达标,或者差距无法用单一的已知原因解释,就停止。有些止损线只要一通电话就会触发,比如一次涉及金钱或法律后果的错误操作。

试点之前的搭建步骤,请看我们的90 天语音 AI 实施计划。

印象不能当结论

30 天过后,经理记得的,是智能体误解了一位生气客户的那一通电话。项目组记得的,是在会上播放过的那些顺利通话。至于没人听过的几百通电话,这两种印象都说明不了什么。

事后挑选的数字也有同样的问题:很容易只挑最好看的那项指标,或者把“已解决”的定义一再放宽,直到合用为止。所以,运营负责人、质检员、系统负责人和项目发起人要在第 1 天之前签署试点评估卡。试点期间,目标值和止损线一律不改。

第 1 步:测出基线

基线是同一来电类型目前的表现,按试点的定义来测量。没有基线,70% 的解决率既说不上好,也说不上坏。一种来电类型就是一个业务流程,对应一个预期结果。本文的示例是:客户来电修改已预约的上门服务时间,通话结束时,应该定下一个客户接受的新时段。

基线要取自可比的时期:

  • 同样的星期几和时段:取完整的四周,覆盖智能体将来接听的时段。
  • 同样的季节或营销活动:不要拿大促周去比平淡的一周,也不要拿节假日那一周去比普通的一周。
  • 同样的来电构成:同样的来电类型、语言和客户群体。如果试点只接晚间来电,基线就是这些晚间来电以前的处理结果,哪怕当时它们只是进了语音信箱。

不要直接沿用旧的话后小结代码:坐席点一下“已解决”,含义可能和预约系统里出现一个新时段并不相同。从基线时期随机抽取一批通话,按试点的规则重新标注,同时用这批样本统计您团队自己的错误操作。没有转人工的电话为什么还不能算已解决,请看我们关于自助率与解决率的文章。

如果某项指标以前从没测过,就在卡上写“未测量”,按业务测算的需要设定目标值,之后也不要声称这项指标有所改善。

第 2 步:填写试点评估卡

试点评估卡上有五项指标,各自回答一个不同的问题,所以一项指标再好看,也掩盖不了另一项的问题。每项指标都写明分子、分母和排除项,然后设定两条线。目标值,是业务测算能够成立的水平。止损线,是不管其他指标表现如何都要停止的水平。介于两者之间,就是未达标。

卡中所有数值都是为本文编写的示例,不是真实企业的数据。

指标精确定义基线目标值止损线
解决率通话结束时,上门服务已改到客户接受的时段、在预约系统中可查,且全程没有转接或回电;这类通话数除以符合条件的通话数。排除:测试电话和其他来电类型。74%70% 及以上低于 60%
重复联系率7 天内通过任何渠道、就同一次上门服务再次联系您的客户数,除以有过符合条件通话的客户数。满 7 天后才计入。12%12% 及以下超过 18%
错误操作率存在记录错误、预约错误或信息错误的已复核通话数,除以已复核通话数。第 1 周复核全部通话,之后每周随机复核 100 通。1.5%(已复核 200 通中有 3 通)1% 及以下超过 3%
转接质量接手同事无需再次询问姓名、预约信息或来电原因的转接次数,除以全部转接次数。未测量90% 及以上低于 75%
人工投入每 100 通符合条件的通话中,员工花在转接、回电、复核和纠错上的分钟数,按第 3 周和第 4 周评估。基线:员工处理这些电话所花的分钟数。640 分钟250 分钟及以下超过 400 分钟

解决率的目标值有意定得比基线低。把原因写在卡上:只要每 100 通电话的人工投入从 640 分钟降到 250 分钟及以下,70% 的解决率就足以让业务测算成立。人工投入只算第 3 周和第 4 周,因为第 1 周要逐通复核全部通话,第一次修复到第 2 周才做。

一通电话就触发的止损线

有些失误代价太高,不能等算出比率再说:

  • 一次涉及金钱或法律后果的错误操作,比如扣款、退款,或取消了一次已付费的上门服务。
  • 向未通过身份核验的来电者透露了个人信息。
  • 来电者报告了危险情况,比如闻到燃气味,却没有马上转到人工坐席。

其中任何一种情况出现,试点都会提前结束,电话当天切回原有路由。修复后重新启动,就是一次新的试点,从第 1 天重新算起。指标类止损线起效慢一些:某项指标的实测值在连续两次每周复盘中都越过止损线,试点才提前结束。“连续两次”只算评估这项指标的复盘:人工投入从第 3 周起算,重复联系要等满 7 天后才算。

每周随机复核的 100 通电话,大多会漏掉上面列出的这些失误,所以要专门去找。每周都要复核以下全部通话:以扣款、退款或取消告终的通话、智能体提供了个人信息的通话,以及客户或同事反映有问题的通话。这些复核是在随机抽样之外另加的。

第 3 步:做好每周复盘

每周复盘固定在同一天开,看同一张卡,核对计数,最多选定一项针对智能体的改动。

周次看什么要回答的问题谁负责决定或修复
第 1 周所有没有达到预期结果的通话、所有转接和所有预约变更,逐一对照预约系统核对。标签和质检员听到的内容一致吗?质检员负责复核。运营负责人决定改什么。
第 2 周评估卡与基线并排对照,附上计数和误差范围。未解决的通话按原因分组。未解决的通话,哪个原因占得最多:智能体、系统,还是业务?运营负责人选定一项修复,由智能体搭建人员或系统负责人实施。
第 3 周修复应该推动的那项指标,以及其余四项。第 1 周和第 2 周的重复联系,这时已满 7 天。修复是否推动了目标指标,又没有拖累其他指标?运营负责人与质检员共同负责。
第 4 周第 1 天以来全部通话的完整评估卡、各条止损线,以及每个比率的误差范围。评估卡支持第 30 天做哪个决定:扩大、延长还是停止?运营负责人起草决定,项目发起人签字。

三条规则,保证各周之间可以比较:

  • 每周只改一处,并记下日期。同时改两处,就分不清是哪一处让数字变了。
  • 定义固定不变。如果发现某个定义有误,只改一次,写明原因,并重新计算之前所有周的数据。
  • 比率旁边写上计数。写“64%(400 通中 256 通)”,不要只写“64%”。

应该复核哪些通话,请看我们的呼叫中心质量抽检指南。

数字能说明什么,不能说明什么

试点中的每个比率都只是估计值。对于在 n 通电话上测得的比率 p,95% 误差范围约为 1.96 × √(p(1 - p) / n)。比率为 70% 时,结果如下:

  • 100 通:约 ±9.0 个百分点
  • 400 通:约 ±4.5 个百分点
  • 1,000 通:约 ±2.8 个百分点

也就是说,一个基于 400 通电话的周数据,通常与真实比率相差在约 4.5 个百分点以内;相邻两周相差几个百分点,可能纯属偶然。这个公式假定各通电话相互独立,并且比率不接近 0% 或 100%。和基线比较时,误差范围更宽:两个约 70% 的比率,各基于 1,600 通电话,二者之差的误差约为 ±3.2 个百分点。

在示例的第 1 周,解决率为 64%,基于 400 通电话,误差约 ±4.7 个百分点。真实比率可能落在约 59.3% 到 68.7% 之间:这个区间横跨止损线,而且整体低于目标值。到第 30 天,示例累计 1,600 通电话,解决率 68%,误差约 ±2.3 个百分点。区间约为 65.7% 到 70.3%,明显高于止损线,目标值刚好落在区间之内。

示例,并非真实数据:解决率与止损线、目标值和基线的对比。第 1 周的区间(400 通)横跨止损线。第 30 天的区间(1,600 通)更窄,目标值刚好落在区间之内。

另外还有三点局限:

  • 罕见事件。复核 300 通电话没有发现一次错误操作,真实比率仍可能高达约 1%。这就是“三法则”:n 通电话中一次都没有出现时,95% 置信上限约为 3 / n。每一次错误操作都要逐一查看并归类。
  • 细分样本太小。某一种语言或某一个星期几只有 60 通电话,在 70% 的比率下,误差约为 ±11.6 个百分点。这些电话要逐通去听,不要拿它们的比率做比较。
  • 近期的重复联系。到第 30 天,重复联系率只覆盖第 23 天及以前的通话。之后的通话还不满 7 天。

第 30 天的决定:扩大、延长或停止

第 30 天,用第 1 天以来的全部通话计算试点评估卡,然后按以下顺序套用规则:

  • 停止:越过任一止损线、三项或以上指标未达标,或者差距无法用单一的已知原因解释。电话切回原有路由,原因记录下来,留给下一次试点参考。
  • 扩大:每项指标都达到目标值,且没有越过任何止损线。分步把同一来电类型的更多电话交给智能体,沿用同一张卡。换一种来电类型,就要另做一张试点评估卡。
  • 延长:一两项指标未达标,且出自同一个已知原因。只延长一次,为期两周,针对这个原因只做一项修复,沿用同一张卡,并且只用延长期内的通话来评估。届时如果每项指标都达到目标值,就扩大。否则,决定就是停止。
第 30 天的决定:三条路径,每条的条件都在第 1 天之前约定好。

结果有好有坏,怎么解读

第 30 天常见的情况是结果有好有坏:四项指标达到目标值,一项没有。

  • 不要取平均。解决率再高,也抵消不了一次预约错误。
  • 先保护客户。错误操作率和一通电话就触发的止损线,绝不拿来和解决率或人工投入做取舍。如果错误操作率未达标,只有每一次错误操作都出自同一个已知原因,而且修复能消除这个原因,才可以延长。
  • 对照误差范围看差距。68% 没有达到 70% 的目标值。但差距小于误差范围、原因又已知,这正是适合延长的典型情况。
  • 弄清原因出在哪里。如果通话失败是因为根本没有空余时段,智能体再好也解决不了。如果人工投入没有达到目标值,看看它从第 3 周到第 4 周是否还在下降。

示例:第 30 天的试点评估卡

示例数值,并非真实数据。

指标目标值第 30 天结果解读
解决率70% 及以上68%(1,600 通中 1,088 通,±2.3 个百分点)未达标,差距小于误差范围
重复联系率12% 及以下11%(第 23 天及以前的通话)达标
错误操作率1% 及以下0.6%(已复核 700 通中有 4 通)达标,每一例都已查看并归类
转接质量90% 及以上92%(250 次转接中 230 次)达标
人工投入250 分钟及以下230 分钟(第 3 周和第 4 周)达标
一通电话就触发的止损线0 例0 例未越过止损线

一项指标未达标,没有越过任何止损线。未解决的通话中,最大的一组是客户想要晚间时段,而预约系统里的晚间时段只对员工可见。原因已知,一项修复就能解决,所以决定是延长:为期两周,沿用同一张卡,并向智能体开放晚间时段。按每周约 400 通电话计算,延长期内约有 800 通新通话可供评估,在 70% 的比率下,误差约为 ±3.2 个百分点。

DRING 能帮上什么

使用 DRING,智能体一周就能上线。利用这一周,重新标注从过往通话中抽取的基线样本,并在第一通真实电话之前签好试点评估卡。每个 DRING 智能体在接第一通真实电话之前,都会跑 1,000 至 10,000 次专为您企业生成的模拟对话。这是上线前的测试,不是试点。模拟能及早暴露问题,但给不出基线,也测不出真实客户的解决率。模拟对话覆盖哪些内容,请看我们关于模拟对话的文章。

试点期间,通话后分析可以按您的定义输出额外字段,比如每通电话的处理结果,并通过 API、您的 CRM、数据看板和报表返回。质检员仍然要听通话,这些字段则让每周复盘都使用同一套标签。我们的通话分析页面展示了数据看板和报表。

先把标准定下来

留下您的号码,DRING 两分钟内给您回电。电话里说说您想试点哪种来电类型,我们的团队随后会和您一起,在第一通真实电话之前定好试点评估卡。