API 可观测性

查看请求健康、token、费用、缓存与延迟

KeepRouter 记录解释请求所需的运行元数据——模型、路由、状态、token、费用、缓存状态和延迟——但不会把 prompt 或 completion 正文写入请求日志。

最后复核 2026-08-15 · 编辑复核: KeepRouter Editorial

以单次请求为证据单位

聚合图能显示趋势,但请求行才能解释发生了什么。KeepRouter 用户控制台提供请求级元数据与时间聚合用量,帮助团队把“成本上涨”追溯到具体模型、token 方向、状态和延迟。

记录哪些字段

请求日志保存时间、请求模型、公共路由、HTTP 状态、实测输入/输出 token、记录费用、可用时的缓存状态或数量,以及延迟。它不保存 prompt 或 completion 正文。账户与 Key 标识用于访问控制与归因。

数据可以回答的问题

  • 本周哪个模型产生了最多输入 token?
  • 成本增长来自请求变多、上下文变大还是输出变长?
  • 失败是否集中在某个路由或模型 ID?
  • 重复请求是否命中可选响应缓存?
  • 哪些请求超过延迟预算?
  • Key 的实际模型使用是否符合白名单和预期应用?

它不能单独回答的问题

网关元数据不能证明回答质量、上游根因或 SLA。200 响应仍可能语义不佳;路由健康为绿时,某个上游账户也可能正在限流。请把请求元数据与应用评测、trace 和用户结果结合,而不是把网关当作完整可观测栈。

不泄露内容地调试

在应用侧记录 correlation ID 和安全元数据。调查时用请求时间、模型、状态、token 和延迟找到匹配事件;敏感内容用合成 prompt 复现。除非内部政策允许,不要把生产 prompt 复制到支持工单。

把证据转成控制

用实测用量设置输出上限、Key 消费限制、应用并发和模型白名单。在扩大流量前审查最慢和最昂贵的代表性请求。只有改变部署或预算决策时,可观测性才真正产生价值。

使用 AI Gateway 延迟指南把网关开销与上游生成时间分开,再按多模型成本方法核对各次尝试、token、缓存处理和费用。

常见问题

KeepRouter 会记录 prompt 或模型回答吗?

请求日志不会。它只保存模型、路由、状态、token、费用、缓存状态和延迟等运行元数据。

可以把仪表盘当作 SLA 监控吗?

不可以。它提供用量与请求证据;公共健康端点也不会对每个上游模型发起真实推理。

如何调查单次请求?

用时间和 request identifier 关联模型、路由、状态、token、费用与延迟,必要时再安全复现。

什么情况应触发模型复查?

重复失败、延迟超预算、token 增长、异常模型使用或费用分布变化都应触发有界复查。

参考的一手资料

  1. [1] OpenTelemetry trace concepts
  2. [2] KeepRouter security and data handling

继续阅读

先测量,再优化

发送一个有上限的请求,并检查这次调用记录的准确元数据。

创建免费 Key · 查看实时模型与价格 · 阅读 Markdown 版本