客服 Agent 每件解决成本:一份可复用的测量表

token 单价只是客服 Agent 的一个投入项,不是最终经济结果。应在工单层分类结果,把模型扣费与重试、审核人工关联,再分别除以已验证解决和正确转人工数量;保留分母,避免便宜请求掩盖更差的客户结果。

发布 2026-09-28 · 更新 2026-09-29 · KeepRouter Editorial · 5 分钟阅读

覆盖契约、证据、失败、安全与运维的 AI Gateway 评估表
比较含重试与人工审核的已验证结果成本,而不是单次模型调用价格。

直接结论:客服 Agent 的候选方案应比较每件已验证结果的成本,而不是每次模型调用的价格。一件工单可能包含检索、多轮模型、工具、重试和人工审核。先按工单标注结果,再汇总整件工单花费。网关请求日志可以证明 token 与扣费,不能单独证明客户问题已经解决。

本文是一份方法和假设算例,不是 KeepRouter 客户研究,也不声称自动化客服一定比人工便宜。客服团队页面说明安全发布路径。

先定义分母

工单标签需要的证据计入什么
已验证自主解决客户确认,或按工单规则独立复核通过已验证解决数
正确转人工必需事实、权限和对话记录传给有权限的人单独记录的可接受结果
重新打开同一问题在约定窗口内回来失败与复核队列
无依据回答断言缺少获批知识依据失败与知识修复
不安全工具操作越权或修改了错误记录事故,绝不算解决

收集结果前先公开重开窗口和复核规则,否则团队可能通过提前关单夸大解决率。草稿、检索来源和工具参数应留在受隐私控制的应用 trace 中,不能把网关 200 响应当作已解决。OpenAI 的Agent 评估指南说明模型、工具、安全关卡与交接如何进入 trace;Anthropic 的工具文档明确客户端工具由应用执行。

建立成本账本

每件工单汇总实际扣费的模型请求,而不是把公开单价乘上理想轮数。再加入重试、检索或向量调用、外部工具费用与人工审核时间。各列应分开:

字段单位来源
模型扣费每次请求 USD网关用量记录或厂商发票
重试与失败轮次每件工单 USD按工单 ID 汇总请求账本
检索与工具费用每件工单 USD索引或工具服务账本
人工审核分钟 × 完整时薪人力账本,并说明假设费率
结果固定工单标签之一独立复核或客户信号

KeepRouter 的用量页记录模型、路由、状态、实测 token、延迟和扣费;请求日志不保存 prompt 或回答正文。应用需附加自己的工单 ID 和最终结果,用私有连接键关联,避免把客户文本或账户信息放入公共遥测。

只用于演示的算例

假设测试期间有 100 件工单:60 件已验证自主解决,25 件正确转人工,15 件重开、无依据或不安全。假设模型与重试合计 $18,检索与工具 $6,人工审核按 $36 计,总成本为 $60。

  • 把整个项目成本都分摊给自主解决件数:$60 / 60 = $1.00,即每件已验证自主解决成本。
  • 如果规则把正确转人工也算可接受结果:$60 / (60 + 25) = $0.71,为四舍五入后的每件可接受结果成本。
  • 失败占比是 15 / 100 = 15%,不会因为平均费用低而被抵消。

这些数字只是人为假设,不是基准测试或 KeepRouter 当前价格。第一种比例故意把失败与升级的成本也分摊给解决件数;第二种回答不同问题。两种都应连同分母报告,不要只挑好看的数字。若要与纯人工或另一个模型公平比较,必须保持相同工单结构、复核规则、服务时段与质量门槛,还要考虑平均值遮蔽的低频高影响错误。

换模型时不要移动门槛

建立固定脱敏案例集:简单查询、过期政策陷阱、缺失账户记录、越权工具请求、情绪化投诉和必须转人工的问题。固定知识版本与工具权限,再用实时目录中的准确模型 ID 与路由跑每个候选。先评判解决、升级、无依据断言与工具参数,质量不过关就不继续比较价格。

离线评估之后,只给一小部分获准用户切换。记录工单 ID、模型 ID、应用版本、检索版本、请求 ID 和最终结果;在同一时间窗内把网关费用并入工单账本。回退时不得重放退款或账户修改。Agent 构建指南说明工具重试和步骤上限;网关评估框架提供更完整的迁移门槛。

正确升级人工与自主解决分开统计

正确升级人工是有用结果,但不是自主解决。两种数量与费用分别报告,不能为了改善标题数字就更改分母。更换模型或提示词时,用相同案例和规则比较;OpenAI Agent 评估指南介绍工具,不会替你的业务定义成功。重新打开的工单应关联原测量窗口,不能隐藏后续失败。

怎样发布可信结果

报告工单总数和被复核数量、重开窗口、可接受结果定义、模型与路由版本、质量失败、p95 延迟及各类费用,同时说明没测量什么。若没有真实客户工单或独立标签,就称之为模拟。不能把合成对话写成客户节省成绩。真正有用的决定是某条获准负载能否通过质量与预算门槛,而不是谁的标价 token 最低。

常见问题

为什么不用模型请求总数做分母?

请求不是客服结果。一件工单可能有多轮、重试或人工审核,应该单独报告工单级结果。

正确转人工算解决吗?

应单独统计。它可以是可接受结果,却不能当成自主解决,否则会夸大解决率。

文中的算例是客户结果吗?

不是。算例中的全部数字都是假设,只用于展示算法。

参考的一手资料

本文最近复核 2026-09-29

  1. [1] OpenAI agent evaluation guide
  2. [2] Anthropic tool use guide
  3. [3] KeepRouter usage and observability
  4. [4] KeepRouter live model catalog

继续阅读

← 全部文章 · 模型与价格 · 获取 API Key