KeepRouter 博客
关于 AI Gateway、协议迁移、模型路由、API 成本控制与评估的证据导向指南。
按研究问题阅读
迁移十月代码模型
选择 Responses 或 Messages,保留思考历史并验证完整工具循环。
Claude 5.5 迁移选择 MiMo 与 GLM 变体
停用旧线路前,核对准确型号、多模态输入与思考成本。
GLM 5.3 变体选型接入工作流应用
配置 n8n 与 Dify,并核对输入、所选模型和已发布工作流。
Dify 配置与排错配置编码助手
验证仓库修改、工具调用,以及聊天与自动补全各自使用的模型。
Continue 聊天与自动补全接入 SDK 与检索应用
连接 LangChain 或 LlamaIndex,分别验证模型行为与检索证据。
LlamaIndex 生成与 RAG排查 API 请求失败
先区分限流、额度不足和流式中断,再选择重试策略。
诊断流式输出中断核算完整工作量
把检索、推理、重试和合格结果纳入可复算的成本表。
核对推理 token 费用评估模型与网关
用已标注样本比较文档提取,再选择适合应用的服务。
比较网关替代方案
全部 55 篇文章
GPT-6.1 Sol API:Responses、工具调用与可靠迁移
2026-10-03
使用 Responses 接入 GPT-6.1 Sol,保留工具历史,比较 Luna 与 Sol,并核对思考、缓存输入和 KeepRouter 固定费率。
Claude Sonnet 5.5 与 Opus 5.5:API 迁移与缓存成本
2026-10-03
用 Messages、自适应思考、完整工具块和准确缓存核算迁移 Claude 5.5,切换 Agent 前比较 Sonnet 与 Opus。
MiMo V2.6 API:Flash、Pro、UltraSpeed 与 V2.5 迁移
2026-10-03
选择确切 MiMo V2.6 ID,保留工具历史中的思考,比较服务变体,并在小米 10 月 21 日停用 V2.5 前完成迁移。
GLM 5.3、Flash 与 FlashX:输入、思考与 API 成本
2026-10-03
比较准确 GLM 5.3 ID、文字与多模态输入、持续思考和实际用量,避免混淆 Coding Plan 权益与按量计费。
Grok 4.7、Qwen 3.8、Gemma 4 与 Doubao 2.1:按任务选型
2026-10-03
按模态、部署限制与合格结果成本比较准确 Grok、Qwen、Gemma、Doubao ID,提供可复现选型表和验收方法。
KeepRouter Gemini API:模型选择、接入与费用核对
2026-09-29
在 KeepRouter 选择九个 Gemini 型号,使用 OpenAI SDK 接入,查看实时 token 价格与流式、JSON、工具调用的验证范围,按合格结果评估成本。
n8n 接入 OpenAI 兼容 API:配置与工作流排障
2026-09-29
从一个可检查的分类工作流开始,配置 n8n 的 OpenAI 兼容 API,区分端点、凭证和多条数据映射问题,再决定是否启用 Agent 工具。
Dify 自定义模型:接入 OpenAI 兼容 API
2026-09-29
配置 Dify 自定义模型的凭证、API 模式与能力,区分聊天和知识库向量模型,并通过一个小工作流定位验证失败。
LangChain 自定义 Base URL:兼容 API 接入指南
2026-09-29
正确设置 ChatOpenAI 的 base_url,分开验证普通调用、流式输出与工具调用,并识别更换端点时可能丢失的供应商扩展字段。
LlamaIndex OpenAILike:更换 LLM,保留 RAG 索引
2026-09-29
使用 OpenAILike 更换 LlamaIndex 的生成模型,保留向量模型与索引,通过可复现的文档样本分别验证检索、回答和引用。
Cline 接入 OpenAI 兼容 API:模型、工具与费用
2026-09-29
为 Cline 配置兼容 API,正确填写模型限制,并用一个可检查的小补丁验证读文件、改代码和运行测试的完整过程。
Roo Code 停运后迁移:保留 API,替换代码客户端
2026-09-29
Roo Code 已归档。为现有用户梳理 API 配置、原生工具和权限的迁移方法,通过小任务验证替代客户端,而非继续推荐旧扩展。
Continue API 配置:分清聊天与自动补全角色
2026-09-29
在 Continue 中分别配置聊天、编辑和自动补全角色,接入兼容端点,并检查 Responses API 选择、模型限制与真实调用费用。
Aider 接入 OpenAI 兼容 API:配置与编辑验证
2026-09-29
配置 Aider 自定义 API,区分 openai/ 客户端前缀与服务端模型 ID,处理模型元数据警告,并核算合格代码修改的成本。
Open WebUI 自定义 API:连接模型与排查功能差异
2026-09-29
在 Open WebUI 添加兼容 API,区分模型发现与真实生成,分别核对聊天、向量、附件和后台任务,避免误判连接成功。
LibreChat 自定义端点:模型、标题与 API 费用
2026-09-29
为 LibreChat 添加自定义端点,使用小范围模型列表、服务端凭证,并检查标题生成与其他后台调用,准确评估完整对话费用。
Structured Outputs 与 JSON Mode:如何验证真实数据
2026-09-29
区分 JSON Mode 与 Schema 约束输出,用缺失字段、冲突金额和拒答样本验证抽取质量,并把业务正确性纳入模型选择。
LLM 工具调用:实现完整的请求与结果循环
2026-09-29
保留工具调用 ID,校验参数,处理流式片段与重复动作,搭建可验证的工具往返流程,并统计完整任务成本。
OpenAI 兼容 API 的 429 错误:限流、额度与重试
2026-09-29
按错误来源与响应体区分 429,结合请求和 token 配额计算吞吐,并限制 SDK、队列和工作流的重试叠加。
LLM 流式输出中断:区分 SSE、超时和完成状态
2026-09-29
排查 LLM 流式输出提前停止,区分网络分片、协议事件、结束原因和用量记录,避免把部分文字当成成功答案。
上下文超限怎么办:先核算提示词,再决定重试
2026-09-29
把历史、工具定义、检索片段和输出预留放进同一 token 预算,解决上下文超限,同时保留回答真正需要的证据。
RAG 每次查询多少钱:别只计算生成 token
2026-09-29
把建库、检索、生成、重试和人工复核放进同一张成本表,用可复算的示例比较每个合格答案的费用,而不只看 token 单价。
推理 token 怎么计费:避免重复计算与短回答误判
2026-09-29
区分可见回答、推理 token 与不同 API 的 usage 口径,用可复算示例避免重复计费统计,并衡量真正完成任务的成本。
GPT、Claude、Gemini 文档提取选型:样本与评分方法
2026-09-29
用统一样本、证据规则和成本账本比较 GPT、Claude、Gemini 的文档提取能力,分开验证 PDF 接入、字段准确度和人工复核成本。
Batch API 与实时请求:什么时候批处理更划算
2026-09-29
比较原生 Batch、应用队列和实时推理,计算折扣是否覆盖工程成本,并正确处理乱序结果、截止时间和失败重试。
Ollama 本地模型与托管 API:成本、容量与盈亏平衡
2026-09-29
把硬件、电费、运维、质量与容量放进同一成本模型,比较 Ollama 本地推理和托管 API,避免仅凭免费软件判断哪个更便宜。
向量模型迁移:重建索引时如何保住检索质量
2026-09-28
生产环境向量模型迁移指南:保存源数据、建立并行索引、双写更新、验证召回与权限、灰度切换并保留回滚。
客服 Agent 每件解决成本:一份可复用的测量表
2026-09-28
按已验证解决与正确转人工衡量客服 Agent 经济性,纳入模型调用、重试、人工审核、失败率与标明假设的算例。
DeepSeek API 价格:缓存命中后,怎样不重复计算输入费用
2026-09-23
按未缓存输入、缓存命中和输出估算 DeepSeek API 费用,包含算例、usage 解析代码与可复现的缓存实验。
Claude API 费用:按写入、读取和复用次数规划 Prompt Caching
2026-09-23
分别核算 Claude 提示词缓存写入与读取费用,用盈亏平衡算例、usage 字段和具体线路验证建立预算。
GPT API 价格与 SDK 迁移:把请求契约和费用一起核对
2026-09-23
迁移 GPT 客户端时,分别检查模型 ID、Chat Completions、Responses、缓存输入与实测用量,附 Python 请求和验收表。
用 OpenAI SDK 调用 Gemini:区分原生、兼容端点和网关路径
2026-09-23
用文本、工具、图片、流式和专有字段的请求矩阵选择 Gemini API 路径,附 Python 配置与费用核对方法。
Doubao 多模态 Embedding:建立一个图文检索小样本
2026-09-23
调用 Doubao 多模态向量端点,校验返回向量、避免把独立文档合并,在扩大索引前验证图文检索质量与成本。
从 OpenRouter 迁移到 KeepRouter:核对 URL、模型 ID 与路由字段
2026-09-23
一份具体的 OpenRouter 迁移手册,涵盖客户端配置、模型命名空间、provider 字段、验收案例与完整回滚步骤。
KeepRouter API Key 配置:从免费模型走到一次受控付费请求
2026-09-23
创建有范围的 KeepRouter Key,运行免费模型请求并定位配置错误,再核对余额、模型范围与付费调用用量。
OpenRouter 与 LiteLLM:按实际工作负载比较总运行成本
2026-09-23
用成本工作表、三种工作负载与有边界的验证计划,比较托管模型访问与自行运行 LiteLLM 代理的实际成本。
长任务完成回调:签名、重试,以及为什么它不是唯一路径
2026-09-13
长任务完成回调如何工作:签名事件契约、重试阶梯、幂等处理,以及为什么轮询仍然是事实来源。
图生视频与视频编辑 API:media 输入契约
2026-09-13
图生视频、参考生视频与视频编辑如何接收输入:各模型的 media 数组、可被上游抓取的 URL、输入长度规则,以及每秒费率。
提示词缓存成本:算清读取、写入与实际节省
2026-09-13
通过完整算例核算提示词缓存费用,区分读取与写入,避免重复计算输入 token,并用实际使用间隔检查缓存是否省钱。
异步视频生成 API:任务 ID、轮询与按秒计费
2026-09-12
异步视频生成 API 如何工作:提交任务、轮询取回视频,并按视频秒数而非 token 计费。文中包含失败处理方式。
如何选择视频模型档位:每秒成本、分辨率与输入类型
2026-09-12
如何在已发布的视频档位之间做选择:每秒成本计算、分辨率档位到底改变了什么,以及各模型接受的输入类型。
文本转语音计费:输入 token 加音频秒数
2026-09-12
按文本输入 token 与生成音频秒数估算 KeepRouter TTS 费用,包含 Gemini 算例、WAV 时长测量与计费边界。
多模态向量:把文本、图片与视频放进同一个向量空间
2026-09-12
支持图片与视频的向量模型位于独立端点。本文说明请求结构、媒体 token 如何计数,以及什么时候该用它。
AI Gateway 指南:它控制什么、何时需要,以及如何落地
2026-08-15
一份实用的 AI Gateway 指南:职责、运行模式、采用测试、能力边界与上线清单。
OpenAI 兼容 API 迁移清单
2026-08-15
用端点、模型、流式、工具、错误、用量、灰度与回滚检查,安全迁移 OpenAI 风格客户端。
LLM 路由与负载均衡:团队最常混淆的四种策略
2026-08-15
区分 LLM 路由、负载均衡、故障切换与重试,并为每种策略定义安全资格与证据。
如何降低 LLM API 成本:按任务复算费用与优化收益
2026-08-15
通过完整算例计算每个合格任务的费用,判断何时应优化缓存、上下文、模型选择或重试次数,降低实际 LLM API 账单。
Responses API 与 Chat Completions:按契约选择,而不是追新
2026-08-15
按对象模型、工具、状态、流式、存储、迁移工作量与 Gateway 支持比较 Responses 和 Chat Completions。
如何评估 AI Gateway:测试方法、费用与完整评分表示例
2026-08-15
用完整评分表示例比较 AI Gateway 的必需功能、任务质量、全部费用和延迟,并按清晰步骤完成试用与小规模发布。
从 OpenRouter 迁移:先选择目标运行模式
2026-08-15
按供应商策略、模型 ID、协议、证据、数据控制、灰度与回滚,把 OpenRouter 工作负载迁移到新的运行模式。
AI Gateway 安全清单:信任控制面之前,先画清数据路径
2026-08-15
一份生产级 AI Gateway 安全审查,覆盖身份、供应商 Key、提示词数据、日志、保留、路由、租户隔离、工具与故障证据。
AI Gateway 延迟指南:分别测量网关、供应商与获救请求
2026-08-15
使用首 token、总完成时间、网关处理、供应商生成、重试、缓存与分位数测试设计,正确测量 AI Gateway 延迟。
LLM 故障切换设计指南:恢复请求,同时避免不安全重试
2026-08-15
用错误分类、截止时间、流式状态、幂等性、费用证据与回滚测试,设计有边界的 LLM 重试和供应商或模型故障切换。
KeepRouter 上的 Kimi K3:使用 1M token 上下文窗口
2026-07-23
通过 OpenAI SDK 或 Claude Code 调用 kimi-k3,并用实测用量而不是估算判断长上下文成本。
不用静态价格快照,比较 Claude Code 模型成本
2026-07-05
用当前端点、费率、资格和同一仓库任务的实测 token,比较 Claude Code 兼容模型 ID。