# 先验证接入，再用同一工作负载比较模型

> 有效原型会把链路验证与模型评估分开。先用 free 模型证明认证和响应解析，再用同一个有边界的任务测试付费候选，比较产品真正需要的证据。

_最后复核 2026-08-15 · [编辑复核](https://keeprouter.com/editorial-policy#editorial-team)_

## 第一天：验证链路

创建限定到公开 free 模型的 Key，按[快速开始](/docs/quickstart)操作。先验证非流式响应，若产品需要再验证流式。保存 request ID 并检查实测用量。这样可在不混入付费模型选择的情况下确认 DNS、认证、SDK 配置、响应解析和网关路由。

## 第二天：定义评估

选择一个真实用户任务，固定输入、预期输出、最大 token、超时和通过标准。若产品用工具，加入完整工具往返。从[实时目录](/models)选择两三个兼容候选，不要只依据泛化 benchmark 标签。

## 第三天：比较证据

为每个模型记录 canonical ID、日期、路由、完成状态、输入输出 token、延迟、费用和产品质量分。重复足够次数以暴露明显波动，但应标注为自己的工作负载样本，而非通用榜单。

## 把原型变成产品边界

把模型 ID 与 Key 移入环境配置，为开发与生产建立独立 Key，设置白名单、消费上限和明确超时，并记录重试行为。价格展示应链接实时目录，不要把数值复制进代码。

## 知道何时停止原型

目标不是测试所有模型。当一个选项满足任务契约、基于实测用量的成本可接受且团队有回滚时，就可以停止。工作负载、供应商版本、价格或路由行为显著变化时再重新评估。

## 常见问题

### 应该用 free 模型测试什么？

用它验证认证、SDK 配置、响应解析和日志，不要据此推断付费模型质量。

### 原型应比较多少付费模型？

与路由和任务匹配的小候选集，比没有标准地测试整个目录更有价值。

### 应该把价格复制进原型吗？

不应。价格与可用性会变化，应链接或读取实时目录。

### 原型何时可以进入生产？

完整客户端链路、任务标准、消费边界、失败行为和回滚都测试后才适合生产。

## 参考的一手资料

1. [KeepRouter OpenAPI](https://keeprouter.com/api/openapi.json)
2. [KeepRouter live model catalog](https://keeprouter.com/models)

## 继续阅读

- [quickstart](https://keeprouter.com/docs/quickstart.md)
- [统一 LLM API](https://keeprouter.com/zh/features/unified-llm-api.md)
- [如何用证据型评分卡评估 AI Gateway](https://keeprouter.com/zh/blog/evaluate-ai-gateway.md)
- [如何用一个 API 调用多个 LLM？](https://keeprouter.com/zh/answers/how-to-use-one-api-for-multiple-llms.md)

## 从一次有边界的请求开始

创建限定 free 模型的 Key，先验证客户端链路，再从实时目录批准付费模型。

[创建免费 Key](https://keeprouter.com/login?returnTo=%2Fconsole%2Fkeys%3Fmodel%3Dfree) · [实时模型与价格](https://keeprouter.com/models.md)
