# 客服 Agent 每件解决成本：一份可复用的测量表

> token 单价只是客服 Agent 的一个投入项，不是最终经济结果。应在工单层分类结果，把模型扣费与重试、审核人工关联，再分别除以已验证解决和正确转人工数量；保留分母，避免便宜请求掩盖更差的客户结果。

_发布 2026-09-28 · 更新 2026-09-29 · [KeepRouter Editorial](https://keeprouter.com/editorial-policy#editorial-team) · 5 分钟阅读_

![覆盖契约、证据、失败、安全与运维的 AI Gateway 评估表](https://keeprouter.com/editorial/blog/evaluate-ai-gateway.png)

_比较含重试与人工审核的已验证结果成本，而不是单次模型调用价格。_

**直接结论：**客服 Agent 的候选方案应比较每件已验证结果的成本，而不是每次模型调用的价格。一件工单可能包含检索、多轮模型、工具、重试和人工审核。先按工单标注结果，再汇总整件工单花费。网关请求日志可以证明 token 与扣费，不能单独证明客户问题已经解决。

本文是一份方法和假设算例，不是 KeepRouter 客户研究，也不声称自动化客服一定比人工便宜。[客服团队页面](/zh/built-for/customer-support-agents)说明安全发布路径。

## 先定义分母

| 工单标签 | 需要的证据 | 计入什么 |
| --- | --- | --- |
| 已验证自主解决 | 客户确认，或按工单规则独立复核通过 | 已验证解决数 |
| 正确转人工 | 必需事实、权限和对话记录传给有权限的人 | 单独记录的可接受结果 |
| 重新打开 | 同一问题在约定窗口内回来 | 失败与复核队列 |
| 无依据回答 | 断言缺少获批知识依据 | 失败与知识修复 |
| 不安全工具操作 | 越权或修改了错误记录 | 事故，绝不算解决 |

收集结果前先公开重开窗口和复核规则，否则团队可能通过提前关单夸大解决率。草稿、检索来源和工具参数应留在受隐私控制的应用 trace 中，不能把网关 200 响应当作已解决。OpenAI 的[Agent 评估指南](https://developers.openai.com/api/docs/guides/agent-evals)说明模型、工具、安全关卡与交接如何进入 trace；Anthropic 的[工具文档](https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview)明确客户端工具由应用执行。

## 建立成本账本

每件工单汇总实际扣费的模型请求，而不是把公开单价乘上理想轮数。再加入重试、检索或向量调用、外部工具费用与人工审核时间。各列应分开：

| 字段 | 单位 | 来源 |
| --- | --- | --- |
| 模型扣费 | 每次请求 USD | 网关用量记录或厂商发票 |
| 重试与失败轮次 | 每件工单 USD | 按工单 ID 汇总请求账本 |
| 检索与工具费用 | 每件工单 USD | 索引或工具服务账本 |
| 人工审核 | 分钟 × 完整时薪 | 人力账本，并说明假设费率 |
| 结果 | 固定工单标签之一 | 独立复核或客户信号 |

KeepRouter 的[用量页](/zh/features/api-observability)记录模型、路由、状态、实测 token、延迟和扣费；请求日志不保存 prompt 或回答正文。应用需附加自己的工单 ID 和最终结果，用私有连接键关联，避免把客户文本或账户信息放入公共遥测。

## 只用于演示的算例

假设测试期间有 **100 件工单**：60 件已验证自主解决，25 件正确转人工，15 件重开、无依据或不安全。假设模型与重试合计 **$18**，检索与工具 **$6**，人工审核按 **$36** 计，总成本为 **$60**。

- 把整个项目成本都分摊给自主解决件数：$60 / 60 = $1.00，即每件已验证自主解决成本。
- 如果规则把正确转人工也算可接受结果：$60 / (60 + 25) = $0.71，为四舍五入后的每件可接受结果成本。
- 失败占比是 15 / 100 = 15%，不会因为平均费用低而被抵消。

这些数字只是人为假设，不是基准测试或 KeepRouter 当前价格。第一种比例故意把失败与升级的成本也分摊给解决件数；第二种回答不同问题。两种都应连同分母报告，不要只挑好看的数字。若要与纯人工或另一个模型公平比较，必须保持相同工单结构、复核规则、服务时段与质量门槛，还要考虑平均值遮蔽的低频高影响错误。

## 换模型时不要移动门槛

建立固定脱敏案例集：简单查询、过期政策陷阱、缺失账户记录、越权工具请求、情绪化投诉和必须转人工的问题。固定知识版本与工具权限，再用[实时目录](/models)中的准确模型 ID 与路由跑每个候选。先评判解决、升级、无依据断言与工具参数，质量不过关就不继续比较价格。

离线评估之后，只给一小部分获准用户切换。记录工单 ID、模型 ID、应用版本、检索版本、请求 ID 和最终结果；在同一时间窗内把网关费用并入工单账本。回退时不得重放退款或账户修改。[Agent 构建指南](/zh/built-for/agent-builders)说明工具重试和步骤上限；[网关评估框架](/zh/blog/evaluate-ai-gateway)提供更完整的迁移门槛。

## 正确升级人工与自主解决分开统计

正确升级人工是有用结果，但不是自主解决。两种数量与费用分别报告，不能为了改善标题数字就更改分母。更换模型或提示词时，用相同案例和规则比较；[OpenAI Agent 评估指南](https://developers.openai.com/api/docs/guides/agent-evals)介绍工具，不会替你的业务定义成功。重新打开的工单应关联原测量窗口，不能隐藏后续失败。

## 怎样发布可信结果

报告工单总数和被复核数量、重开窗口、可接受结果定义、模型与路由版本、质量失败、p95 延迟及各类费用，同时说明没测量什么。若没有真实客户工单或独立标签，就称之为模拟。不能把合成对话写成客户节省成绩。真正有用的决定是某条获准负载能否通过质量与预算门槛，而不是谁的标价 token 最低。

## 常见问题

### 为什么不用模型请求总数做分母？

请求不是客服结果。一件工单可能有多轮、重试或人工审核，应该单独报告工单级结果。

### 正确转人工算解决吗？

应单独统计。它可以是可接受结果，却不能当成自主解决，否则会夸大解决率。

### 文中的算例是客户结果吗？

不是。算例中的全部数字都是假设，只用于展示算法。

## 参考的一手资料

_本文最近复核 2026-09-29_

1. [OpenAI agent evaluation guide](https://developers.openai.com/api/docs/guides/agent-evals)
2. [Anthropic tool use guide](https://platform.claude.com/docs/en/agents-and-tools/tool-use/overview)
3. [KeepRouter usage and observability](https://keeprouter.com/features/api-observability)
4. [KeepRouter live model catalog](https://keeprouter.com/models)

## 继续阅读

- [客服 Agent](https://keeprouter.com/zh/built-for/customer-support-agents.md)
- [Agent 构建者](https://keeprouter.com/zh/built-for/agent-builders.md)
- [API 可观测性](https://keeprouter.com/zh/features/api-observability.md)
- [如何评估 AI Gateway：测试方法、费用与完整评分表示例](https://keeprouter.com/zh/blog/evaluate-ai-gateway.md)
- [api cost calculator](https://keeprouter.com/tools/api-cost-calculator)

## 用你的工作量估算费用

选择型号并填写预计用量，先把估算与一条小规模真实请求对上，再扩大使用。

[估算 API 费用](https://keeprouter.com/tools/api-cost-calculator)

[创建 Key，测试免费模型](https://keeprouter.com/login?returnTo=%2Fconsole%2Fkeys%3Fmodel%3Dfree)

免费测试使用 free 模型；其他付费型号需要足够预付额度。

[全部文章](https://keeprouter.com/zh/blog.md) · [模型与价格](https://keeprouter.com/models.md)
