您不用写一句提示词
您的团队讲清工作内容,并审阅智能体说的话。提示词本身由我们来写、来维护。
写提示词不是您的工作。设想智能体会碰到哪些难缠的电话,也不是。
您的团队讲清工作内容,并审阅智能体说的话。提示词本身由我们来写、来维护。
文档、通话录音、政策,以及您在审阅时留下的意见,都会成为该智能体的测试集。
智能体只有通过这套测试集,才会进入生产环境。在那之前,它只在专用线路上运行。
接第一通真实电话之前,先跑 1,000 至 10,000 次专为您企业生成的模拟对话。模拟对话的数量取决于智能体,每一次都根据您自己的业务流程、文档和通话录音生成,而不是一套通用的基准测试集。
改动也遵循同样的纪律。您给我们的每条规则都会加入该智能体唯一的测试集,只有在所有已有规则同时通过时,新规则才会上线。看看智能体如何搭建
每个智能体都走同一套流程,无论业务场景从外面看起来多简单。
愤怒的来电者、下错的订单、政策陷阱、沉默和插话,都取自您自己的业务流程。
每个客户画像都和智能体完整走一遍对话,而不是只问一个事先写好的问题。
自动评估器为每段对话打分。评估结果不一致时,由人工审核这通电话。
任何版本发布前,结果都会与上一个版本对比,修好一处不会悄悄弄坏另一处。
转给人工的升级路径会被明确验证,而不是默认它能用。
真实流量分阶段逐步增加,每一步都盯着评分,上一个版本随时待命。
自动评估可能出现偏差,也可能漏掉细微之处。独立检查,加上对每次分歧的人工复核,让这个信号比单一分数更有参考价值。
测试不会在上线时停止。只要智能体在运行,就会定期接受质量管控。
通话一结束,解决情况、政策遵循度和响应时间即完成评分,情绪同时打上标签。
每个在线智能体都会定期与上一个版本对比重跑,赶在客户察觉之前发现悄悄出现的退步。
某项评分一旦超出预期范围,就会自动告警,不必等下一次复测。
语音转文字的错误按人名、地名和产品术语追踪,然后在智能体的词典中修正。
| 指标 | 定义 | 为什么重要 |
|---|---|---|
| 解决率 | 客户来电的原因是否真正得到了处理。 | 衡量智能体是否完成本职工作的核心指标。 |
| 情绪 | 客户的语气从通话开始到结束发生了怎样的变化。 | 揪出那些账面上已解决、客户却很不满的通话。 |
| 政策遵循度 | 智能体的操作是否始终在为它配置的规则之内。 | 让智能体守在企业设定的边界之内。 |
| 响应时间 | 从客户说完话到智能体回应之间的间隔。 | 回应慢了,即使答案正确,听起来也像信号不好。 |
| 转人工准确度 | 该转人工的时候,智能体有没有转。 | 漏掉一次该有的升级,比多一次不必要的升级更糟。 |
| 回归差值 | 在同一测试集上,相对上一个版本的分数变化。 | 揪出那些悄悄让智能体变差的版本。 |
哪句开场白、哪种语气、哪个声音效果好,要在真实的外呼电话里见分晓,而不是在会议室里拍板。
开场白、语气、声音、语速、提问顺序,以及应对异议的方式。每个变体只改一个变量,结果才能归因。
依据外呼任务自己的结果,每个变体都要达到约定的最低样本量。情绪和转人工率是护栏:结果上赢了、客户观感却输了的变体,不会上线。
胜出的变体分阶段推广,其他变体下线,改动留有记录,下一次对比从一个已知的基线出发。
推广前,胜出的变体仍要先通过回归测试集,才会覆盖整个外呼任务。
不需要。您讲清工作内容,提供文档和通话录音,并审阅智能体说的话。提示词的编写和维护是我们的工作,测试也是根据您提供的材料构建的,而不是套用通用模板。
是的。回归复测会定期与上一个版本对比运行,每一次改动都和首次上线一样分阶段推出。
这段对话会转给人工复核员,审核之后才确定结果。反复出现分歧,说明评估集本身需要完善。
能。客户画像和场景都围绕您自己的政策和边缘情况构建,上线实施期间您都能看到。
系统会自动发出质量下滑告警,相关通话会被复核,修复后先重新通过测试集,这类来电才会再交回给智能体。