AI帮新手客服追上经验,老员工却未必同样受益

AI客服助手在一项真实企业研究中提高了每小时解决问题的数量,收益更多落在经验较少的员工身上。研究覆盖一家软件企业的5,172名客服,平均提升约15%,资深且原本表现较好的员工改善较小,部分质量指标还有轻微下降。对在加拿大找客服工作或管理小团队的人,这项结果最有用的地方,是帮助区分谁需要提示、谁需要保留判断空间;它没有测出加拿大岗位会增加或减少多少。〔1〕:white_check_mark:源

新人缺的是可用经验,老手缺的可能是时间

刚入职时,困难常在于把客户说的现象对应到产品问题,再找出能执行的处理办法。如果提示工具能够及时提供相关资料和回答步骤,新人可以少绕一些弯。已经熟悉系统的员工,则可能早就知道下一步;额外提示若只是重复常识,阅读和核对反而增加一道工作。

研究里的工具嵌在文字客服流程中,读取对话后给人工客服建议,员工可以采用、修改或忽略,仍由员工与客户沟通。它也能提供相关技术资料入口。由此得到的效果,适用于这种“人在处理问题、系统及时给建议”的安排;换成自主接电话、自动退款或直接改账户,任务和权限都变了。〔1〕:white_check_mark:源

对求职者而言,可以观察公司是否把工具当作带教的一部分:新人能否知道建议依据、遇到例外时能否找人、处理错误后是否有人解释。对管理者而言,更值得比较不同资历员工的结果,避免给整组人订下同一个提速指标。

每小时解决量,把速度和结果放在一起

这项研究的核心指标是每小时成功解决的客户问题数。它综合了处理一段对话要多久、能同时处理多少段对话,以及问题是否解决。作者利用工具分批部署的时间,比较员工获得工具前后与尚未获得工具的员工,并做额外检验。整体研究应按企业分批部署的实证研究来读,不能只凭存在部分随机试点,就把全部员工当成同一场随机试验。〔1〕:white_check_mark:源

这一指标比“回了多少条消息”更接近客服价值。消息变多可能来自解释清楚,也可能来自来回重复;对话变短可能是排障快了,也可能是问题尚未处理就结束。只有把完成情况放回去,速度才有明确意义。

即便如此,研究中的“解决”仍按企业所记录的业务指标定义。一个团队要采用类似办法,仍需说明什么算完成、多久后重开的工单如何处理、转交其他部门算不算解决。不同企业的分母和规则不同,15%的平均增益无法直接变成另一家公司的目标。

《用AI干活自报三倍速度,工作价值没跟着翻三倍》讨论员工对提速和价值的自我判断。这项客服研究多走了一步,使用真实业务记录;仍留下企业外部的服务质量、长期成本和工资变化等问题。

帮助最大的人,往往尚未积累足够案例

作者发现,低技能或经验较少的员工获益更大;研究中的技能分组基于部署前的工作表现,描述的是这份岗位中的表现。它没有给员工的整体能力或未来潜力排等级。提示工具可能把高表现员工积累的处理办法,更快地送到缺少经验的人面前。〔1〕:white_check_mark:源

研究还比较了任职时间曲线:使用工具约两个月经验的员工,在所测指标上可以达到未使用工具、经验超过六个月员工的水平。这是特定企业中的统计比较,无法承诺任何新人两个月就学完全部工作,也没有涵盖授权判断、复杂投诉和每一种罕见事故。〔1〕:white_check_mark:源

对最有经验、原本表现最高的员工,研究发现速度上的小幅改善,同时出现质量上的小幅下降。这让“人人都要更听AI的话”变得缺乏依据。熟练员工遇到的例外、已有经验与系统建议发生冲突时,团队应保留记录和纠正渠道,而非只统计建议采用率。〔1〕:white_check_mark:源

工具暂时停了,人有没有留下本领

一个关键问题是:提示只是替人完成眼前任务,还是让人学到了可迁移的做法?作者利用软件故障期间没有建议可用的时段作观察。曾经接触工具的员工,在这些时段仍比自己使用工具前表现更好;此前接触更多、较常使用建议的人,改善也较明显。〔1〕:white_check_mark:源

这提供了学习发生的迹象,不过故障时段本身没有被随机分配,不能把它解释为已经完成严格的长期脱离工具考试。换产品、换公司或改用中文服务后是否仍能保留同样能力,也需要新的观察。

研究还观察到部分国际员工英语表达改善、客户说话更客气、要求转主管的情况减少。这些结果提醒团队,效率可能通过沟通质量发生,而非单纯打字更快;它们也只覆盖所研究的英语文字服务,无法直接给普通话、粤语或电话口音的效果定量。〔1〕:white_check_mark:源

一张适合小团队的记录表

同时记录的项目 具体看什么 容易漏掉的代价
每小时完成量 有明确完成标准的工单 未解决却提前结单
后续质量 重开、返工、投诉与升级 错误被下一个班次接走
资历差异 新人和熟练员工分别比较 平均值掩盖一组人退步
人工投入 看提示、改答案、审核与带教时间 前台省时、后台增负
学习保留 获准条件下独立解释处理理由 只会照抄、无法发现例外
客户体验 问题是否听懂、交接是否顺畅 话术客气但事情未完成

这张表是根据研究问题整理的团队观察办法,尚未在你的业务中验证。使用时先选范围有限、结果可检查的一类任务,遵守公司对客户资料和工具的规定;比较时尽量保持任务难度、工时与人员构成接近,并把改变过的条件记下来。

最后还要留出工资和工作强度这一层。同样的提效可以变成更好的服务、更少加班、更多接单或更高负荷,取决于组织怎样分配收益。原研究没有观察到企业整体工资和劳动需求的变化,个人表现进步与职业安全之间仍有一段距离。下一次评估一个工具,可以先要求看分资历的完成与返工记录,再讨论要不要把它推给所有人。〔1〕:white_check_mark:源

拓展阅读

小团队搭AI电话客服,Retell AI按使用分钟收费:同版块的站内帖,同样围绕 小团队,往深里读接这一篇。
上次喂奶几点,宝宝生活记录帮新手爸妈记住:还是 帮新手,同版块的另一篇站内帖。
斯坦福AI就业研究更新到19%:年轻人先遇到的是少招聘,不是多裁员:同版块的职业帖,同样围绕 业研究,往深里读接这一篇。

参考资料

  1. Brynjolfsson、Li与Raymond,Generative AI at Work,作者公开修订稿v2 ,arXiv修订稿,2024年11月6日;研究场景、分批部署、生产率、资历差异、故障期学习与局限。本文采用修订稿的5,172人、约15%;早期NBER工作论文为5,179人、约14%。