直接回答
LLM API 如何计费?
LLM API 通常把实测用量乘以公开费率:输入 token、输出 token、缓存输入 token,或图像等按请求单位。总工作负载成本取决于准确模型、提示词大小、生成输出、缓存行为、重试和失败请求计费规则。
最后复核 2026-08-15 · 编辑复核: KeepRouter Editorial
按 token 计价的请求
文本请求的基础计算是:
费用 = 输入 token × 输入费率
+ 输出 token × 输出费率
+ 缓存输入 token × 缓存费率费率可能按每百万 token 展示,但计费使用实测 token。不要假设输入与输出费率相同。长上下文可能让输入占主导;不受限生成可能让输出占主导。
按请求计价的操作
部分图像或专用操作按请求单位而非 token 发布价格。模型页应说明单位,不要把单图价格硬塞进 token 计算器。
为什么静态价格表不够
费率和模型可用性会变化。更重要的是,最低标价模型可能输出更长、需要重试或无法完成任务。当前用户费率看实时目录,实际 token 与费用证据看请求日志。
比较工作负载,而非百万 token 标题
固定输入、输出上限、工具、缓存状态和通过标准。记录每次请求成本和每个成功任务成本。拆分首轮未缓存请求与重复缓存上下文,并计入重试或 fallback。报告样本日期与限制。
消费控制
Key 级上限约束总消费,但不能自动让每个 Agent 循环安全。还需应用步骤上限、输出限制、超时与告警。按服务或环境拆分 Key,让用量可归因,避免一次实验耗尽另一工作负载预算。
常见问题
输入和输出 token 价格一样吗?
通常不一样,请查看准确模型的当前费率。
什么是缓存输入价格?
部分线路在符合条件的重复输入命中模型厂商缓存行为时使用不同费率。
图像按 token 计费吗?
不一定。许多图像操作使用公开的单图或单请求价格。
最有用的成本指标是什么?
对产品决策而言,每个代表性成功任务的成本通常比单独标价更有用。