客服 Agent 每件解决成本:一份可复用的测量表
token 单价只是客服 Agent 的一个投入项,不是最终经济结果。应在工单层分类结果,把模型扣费与重试、审核人工关联,再分别除以已验证解决和正确转人工数量;保留分母,避免便宜请求掩盖更差的客户结果。
发布 2026-09-28 · 更新 2026-09-29 · KeepRouter Editorial · 5 分钟阅读

直接结论:客服 Agent 的候选方案应比较每件已验证结果的成本,而不是每次模型调用的价格。一件工单可能包含检索、多轮模型、工具、重试和人工审核。先按工单标注结果,再汇总整件工单花费。网关请求日志可以证明 token 与扣费,不能单独证明客户问题已经解决。
本文是一份方法和假设算例,不是 KeepRouter 客户研究,也不声称自动化客服一定比人工便宜。客服团队页面说明安全发布路径。
先定义分母
| 工单标签 | 需要的证据 | 计入什么 |
|---|---|---|
| 已验证自主解决 | 客户确认,或按工单规则独立复核通过 | 已验证解决数 |
| 正确转人工 | 必需事实、权限和对话记录传给有权限的人 | 单独记录的可接受结果 |
| 重新打开 | 同一问题在约定窗口内回来 | 失败与复核队列 |
| 无依据回答 | 断言缺少获批知识依据 | 失败与知识修复 |
| 不安全工具操作 | 越权或修改了错误记录 | 事故,绝不算解决 |
收集结果前先公开重开窗口和复核规则,否则团队可能通过提前关单夸大解决率。草稿、检索来源和工具参数应留在受隐私控制的应用 trace 中,不能把网关 200 响应当作已解决。OpenAI 的Agent 评估指南说明模型、工具、安全关卡与交接如何进入 trace;Anthropic 的工具文档明确客户端工具由应用执行。
建立成本账本
每件工单汇总实际扣费的模型请求,而不是把公开单价乘上理想轮数。再加入重试、检索或向量调用、外部工具费用与人工审核时间。各列应分开:
| 字段 | 单位 | 来源 |
|---|---|---|
| 模型扣费 | 每次请求 USD | 网关用量记录或厂商发票 |
| 重试与失败轮次 | 每件工单 USD | 按工单 ID 汇总请求账本 |
| 检索与工具费用 | 每件工单 USD | 索引或工具服务账本 |
| 人工审核 | 分钟 × 完整时薪 | 人力账本,并说明假设费率 |
| 结果 | 固定工单标签之一 | 独立复核或客户信号 |
KeepRouter 的用量页记录模型、路由、状态、实测 token、延迟和扣费;请求日志不保存 prompt 或回答正文。应用需附加自己的工单 ID 和最终结果,用私有连接键关联,避免把客户文本或账户信息放入公共遥测。
只用于演示的算例
假设测试期间有 100 件工单:60 件已验证自主解决,25 件正确转人工,15 件重开、无依据或不安全。假设模型与重试合计 $18,检索与工具 $6,人工审核按 $36 计,总成本为 $60。
- 把整个项目成本都分摊给自主解决件数:$60 / 60 = $1.00,即每件已验证自主解决成本。
- 如果规则把正确转人工也算可接受结果:$60 / (60 + 25) = $0.71,为四舍五入后的每件可接受结果成本。
- 失败占比是 15 / 100 = 15%,不会因为平均费用低而被抵消。
这些数字只是人为假设,不是基准测试或 KeepRouter 当前价格。第一种比例故意把失败与升级的成本也分摊给解决件数;第二种回答不同问题。两种都应连同分母报告,不要只挑好看的数字。若要与纯人工或另一个模型公平比较,必须保持相同工单结构、复核规则、服务时段与质量门槛,还要考虑平均值遮蔽的低频高影响错误。
换模型时不要移动门槛
建立固定脱敏案例集:简单查询、过期政策陷阱、缺失账户记录、越权工具请求、情绪化投诉和必须转人工的问题。固定知识版本与工具权限,再用实时目录中的准确模型 ID 与路由跑每个候选。先评判解决、升级、无依据断言与工具参数,质量不过关就不继续比较价格。
离线评估之后,只给一小部分获准用户切换。记录工单 ID、模型 ID、应用版本、检索版本、请求 ID 和最终结果;在同一时间窗内把网关费用并入工单账本。回退时不得重放退款或账户修改。Agent 构建指南说明工具重试和步骤上限;网关评估框架提供更完整的迁移门槛。
正确升级人工与自主解决分开统计
正确升级人工是有用结果,但不是自主解决。两种数量与费用分别报告,不能为了改善标题数字就更改分母。更换模型或提示词时,用相同案例和规则比较;OpenAI Agent 评估指南介绍工具,不会替你的业务定义成功。重新打开的工单应关联原测量窗口,不能隐藏后续失败。
怎样发布可信结果
报告工单总数和被复核数量、重开窗口、可接受结果定义、模型与路由版本、质量失败、p95 延迟及各类费用,同时说明没测量什么。若没有真实客户工单或独立标签,就称之为模拟。不能把合成对话写成客户节省成绩。真正有用的决定是某条获准负载能否通过质量与预算门槛,而不是谁的标价 token 最低。
常见问题
为什么不用模型请求总数做分母?
请求不是客服结果。一件工单可能有多轮、重试或人工审核,应该单独报告工单级结果。
正确转人工算解决吗?
应单独统计。它可以是可接受结果,却不能当成自主解决,否则会夸大解决率。
文中的算例是客户结果吗?
不是。算例中的全部数字都是假设,只用于展示算法。
参考的一手资料
本文最近复核 2026-09-29
- [1] OpenAI agent evaluation guide
- [2] Anthropic tool use guide
- [3] KeepRouter usage and observability
- [4] KeepRouter live model catalog