API 可观测性
查看请求健康、token、费用、缓存与延迟
KeepRouter 记录解释请求所需的运行元数据——模型、路由、状态、token、费用、缓存状态和延迟——但不会把 prompt 或 completion 正文写入请求日志。
最后复核 2026-08-15 · 编辑复核: KeepRouter Editorial
以单次请求为证据单位
聚合图能显示趋势,但请求行才能解释发生了什么。KeepRouter 用户控制台提供请求级元数据与时间聚合用量,帮助团队把“成本上涨”追溯到具体模型、token 方向、状态和延迟。
记录哪些字段
请求日志保存时间、请求模型、公共路由、HTTP 状态、实测输入/输出 token、记录费用、可用时的缓存状态或数量,以及延迟。它不保存 prompt 或 completion 正文。账户与 Key 标识用于访问控制与归因。
数据可以回答的问题
- 本周哪个模型产生了最多输入 token?
- 成本增长来自请求变多、上下文变大还是输出变长?
- 失败是否集中在某个路由或模型 ID?
- 重复请求是否命中可选响应缓存?
- 哪些请求超过延迟预算?
- Key 的实际模型使用是否符合白名单和预期应用?
它不能单独回答的问题
网关元数据不能证明回答质量、上游根因或 SLA。200 响应仍可能语义不佳;路由健康为绿时,某个上游账户也可能正在限流。请把请求元数据与应用评测、trace 和用户结果结合,而不是把网关当作完整可观测栈。
不泄露内容地调试
在应用侧记录 correlation ID 和安全元数据。调查时用请求时间、模型、状态、token 和延迟找到匹配事件;敏感内容用合成 prompt 复现。除非内部政策允许,不要把生产 prompt 复制到支持工单。
把证据转成控制
用实测用量设置输出上限、Key 消费限制、应用并发和模型白名单。在扩大流量前审查最慢和最昂贵的代表性请求。只有改变部署或预算决策时,可观测性才真正产生价值。
使用 AI Gateway 延迟指南把网关开销与上游生成时间分开,再按多模型成本方法核对各次尝试、token、缓存处理和费用。
常见问题
KeepRouter 会记录 prompt 或模型回答吗?
请求日志不会。它只保存模型、路由、状态、token、费用、缓存状态和延迟等运行元数据。
可以把仪表盘当作 SLA 监控吗?
不可以。它提供用量与请求证据;公共健康端点也不会对每个上游模型发起真实推理。
如何调查单次请求?
用时间和 request identifier 关联模型、路由、状态、token、费用与延迟,必要时再安全复现。
什么情况应触发模型复查?
重复失败、延迟超预算、token 增长、异常模型使用或费用分布变化都应触发有界复查。