# 查看请求健康、token、费用、缓存与延迟

> KeepRouter 记录解释请求所需的运行元数据——模型、路由、状态、token、费用、缓存状态和延迟——但不会把 prompt 或 completion 正文写入请求日志。

_最后复核 2026-08-15 · [编辑复核](https://keeprouter.com/editorial-policy#editorial-team)_

## 以单次请求为证据单位

聚合图能显示趋势，但请求行才能解释发生了什么。KeepRouter 用户控制台提供请求级元数据与时间聚合用量，帮助团队把“成本上涨”追溯到具体模型、token 方向、状态和延迟。

## 记录哪些字段

请求日志保存时间、请求模型、公共路由、HTTP 状态、实测输入/输出 token、记录费用、可用时的缓存状态或数量，以及延迟。它不保存 prompt 或 completion 正文。账户与 Key 标识用于访问控制与归因。

## 数据可以回答的问题

- 本周哪个模型产生了最多输入 token？
- 成本增长来自请求变多、上下文变大还是输出变长？
- 失败是否集中在某个路由或模型 ID？
- 重复请求是否命中可选响应缓存？
- 哪些请求超过延迟预算？
- Key 的实际模型使用是否符合白名单和预期应用？

## 它不能单独回答的问题

网关元数据不能证明回答质量、上游根因或 SLA。200 响应仍可能语义不佳；路由健康为绿时，某个上游账户也可能正在限流。请把请求元数据与应用评测、trace 和用户结果结合，而不是把网关当作完整可观测栈。

## 不泄露内容地调试

在应用侧记录 correlation ID 和安全元数据。调查时用请求时间、模型、状态、token 和延迟找到匹配事件；敏感内容用合成 prompt 复现。除非内部政策允许，不要把生产 prompt 复制到支持工单。

## 把证据转成控制

用实测用量设置输出上限、Key 消费限制、应用并发和模型白名单。在扩大流量前审查最慢和最昂贵的代表性请求。只有改变部署或预算决策时，可观测性才真正产生价值。

使用 [AI Gateway 延迟指南](/zh/blog/ai-gateway-latency-guide)把网关开销与上游生成时间分开，再按[多模型成本方法](/zh/blog/control-multi-model-api-costs)核对各次尝试、token、缓存处理和费用。

## 常见问题

### KeepRouter 会记录 prompt 或模型回答吗？

请求日志不会。它只保存模型、路由、状态、token、费用、缓存状态和延迟等运行元数据。

### 可以把仪表盘当作 SLA 监控吗？

不可以。它提供用量与请求证据；公共健康端点也不会对每个上游模型发起真实推理。

### 如何调查单次请求？

用时间和 request identifier 关联模型、路由、状态、token、费用与延迟，必要时再安全复现。

### 什么情况应触发模型复查？

重复失败、延迟超预算、token 增长、异常模型使用或费用分布变化都应触发有界复查。

## 参考的一手资料

1. [OpenTelemetry trace concepts](https://opentelemetry.io/docs/concepts/signals/traces/)
2. [KeepRouter security and data handling](https://keeprouter.com/security)

## 继续阅读

- [security](https://keeprouter.com/security.md)
- [status](https://keeprouter.com/status.md)
- [模型路由](https://keeprouter.com/zh/features/model-routing.md)
- [如何用证据、限额与责任归属控制多模型 API 成本](https://keeprouter.com/zh/blog/control-multi-model-api-costs.md)

## 先测量，再优化

发送一个有上限的请求，并检查这次调用记录的准确元数据。

[创建免费 Key](https://keeprouter.com/login?returnTo=%2Fconsole%2Fkeys%3Fmodel%3Dfree) · [实时模型与价格](https://keeprouter.com/models.md)
