工程答案
什么是 LLM 路由?
LLM 路由是一套选择策略,用来决定某个请求由哪个已批准模型和服务线路处理。路由可以固定到模型 ID,也可以按任务规则选择,或在多个合格供应商线路中选路。可靠的路由必须有边界:明确候选范围、重试条件、成本上限,并记录最终选择依据,而不是把请求发给任意可用模型。
最后复核 2026-08-26 · 编辑复核: KeepRouter Editorial
四类经常被统称为路由的决策
| 决策 | 变化的对象 | 必须保持受控的部分 |
|---|---|---|
| 模型选择 | 公开模型 ID | 任务质量、工具、输出格式与成本上限 |
| 供应商选择 | 同一模型家族的服务供应商 | 数据策略、区域、模型版本与响应行为 |
| 负载均衡 | 在等价合格线路间分配流量 | 健康标准、权重与容量 |
| 故障切换 | 用其他线路替代失败或不可用线路 | 重试预算、幂等性与批准的回退集合 |
这些决策通常由不同角色负责。产品团队决定可接受的模型行为,平台团队负责线路健康与凭证,财务或产品运营可能负责消费上限。把它们压进一个不透明分数,会让故障难以解释。
先判断是否合格,再谈优化
请求上下文 -> 能力门槛 -> 策略限制 -> 合格线路排序 -> 选定线路 -> 请求证据
线路必须先通过能力门槛,之后才能按成本、质量或延迟排序。应先检查端点、工具支持、输入输出模态、上下文长度、数据策略、区域和评测状态。不合格的模型不能因为便宜或速度快就被选中。
下面只是策略伪配置,不是 KeepRouter API Schema:
{
"endpoint": "chat.completions",
"eligibleModels": ["approved-model-a", "approved-model-b"],
"requirements": {
"tools": true,
"region": "approved-region",
"maxInputTokens": 32000
},
"objective": "quality",
"limits": {
"maxCostPerRequestUsd": 0.08,
"maxAttempts": 2
}
}| 策略目标 | 合格门槛 | 排序信号 | 需要保留的证据 |
|---|---|---|---|
| 质量优先 | 通过任务评测并满足所需能力 | 同一任务集上的评测分数 | 评测版本、请求模型与最终模型 |
| 成本优先 | 通过最低质量与策略门槛 | 相同 token 假设下的预计成本 | token 用量、缓存状态与最终费用 |
| 延迟优先 | 通过质量、区域与能力检查 | 可比较请求的近期 p95 延迟 | 客户端区域、首 token 时间、重试与供应商线路 |
质量应使用实测任务结果,而不是通用排行榜。可用延迟测量答案建立可比计时,用成本控制指南核算单次请求总成本。
路由策略需要封闭候选集合
先确定应用真正调用的端点,例如 Chat Completions、Responses、Messages、向量或图像生成。只把支持该路由且通过同一套评测的模型放进候选集合,然后明确哪些维度允许自动变化。
一套策略可以允许某个已批准模型使用两条供应商线路,同时禁止系统悄悄切换到更便宜的模型家族。另一套策略可以允许摘要任务使用回退模型,但不允许代码执行任务这样做。模型路由功能页解释 KeepRouter 的公开边界,模型路由与负载均衡则进一步说明运行差异。
每个请求都要留下证据
记录请求模型、最终模型、端点、请求 ID、状态、token 用量、费用、延迟,以及是否发生重试或回退。如果供应商身份属于合规决策,就应选择能够公开并控制该信息的产品。KeepRouter 向用户暴露公开模型 ID,但上游映射由运营方管理且不公开。
策略上线前,应逐项核验失败与证据契约:
- 没有合格线路:返回明确的策略错误,不能选择未经批准的模型。
- 容量不足或限流:记录被拒线路、重试决定、等待时间与下一条线路。
- 超时:保留尝试次数与耗时,避免把供应商变慢误判为网关开销。
- 流式输出中断:重试前记录是否已有内容到达调用方,避免重复副作用。
- 最终成功:保留请求与选定模型、端点、用量、费用、延迟、回退标记和关联 ID。
API 可观测功能说明 KeepRouter 提供的证据面,LLM 故障切换答案则说明首条合格线路失败后的重试边界。
可执行的上线顺序
- 固定一组代表性测试,包括工具、长输入、错误请求、流式和预期失败。
- 使用同一通过标准批准候选 ID。
- 定义可重试错误、超时预算和最大尝试次数。
- 使用权限受限的 Key 和小流量分组测试策略。
- 比较任务结果、失败率、实测用量和单次请求总成本。
- 在新策略稳定前,把旧线路保留为已测试回滚。
把模型 ID 移入部署配置前,先阅读如何不改代码切换模型。选择网关时,应使用 AI Gateway 评估指南,不要只数功能数量。
路由不应该越过的边界
除非操作幂等或有稳定 operation key 保护,否则不要对带副作用的 Agent 调用自动重试。不要替换为未经工具与安全测试的模型。不要假设不同供应商托管的同名模型就是完全相同的服务。路由可以减少接入工作,但不能替代模型评测与故障责任。
常见问题
LLM 路由就是切换模型吗?
切换模型只是其中一种路由决策。路由还可能选择供应商、在等价线路间均衡流量,或在批准集合内故障切换。
路由器可以选择任意可用模型吗?
不应该。生产路由应使用封闭模型集合,并确保这些模型已通过任务所需的端点、工具、质量和成本检查。
路由一定会降低成本吗?
不会。策略可以偏向成本,但重试、更长输出、缓存行为和质量失败都可能增加总成本。
应该记录供应商身份吗?
当供应商选择影响合规、区域、调试或采购时应该记录。如果网关隐藏该身份,应明确记录这个边界。
Agent 调用可以安全故障切换吗?
只有副作用具备幂等性或有防重复保护,并且所有回退模型通过相同工具和行为测试时才可以。
参考的一手资料
- [1] OpenRouter provider routing
- [2] Cloudflare AI Gateway dynamic routing
- [3] Vercel AI Gateway provider options