计费说明 · 更新于 2026-10-03
缓存读取、缓存创建价格与命中率
区分普通输入与缓存 Token,读懂积分扣费和仪表盘的缓存命中率。
四类 Token 的区别
- 普通输入:本次需要处理、未从缓存读取的输入。
- 输出:模型生成的内容。
- Cache Read:从上游缓存读取的输入 Token。
- Cache Creation:上游创建缓存使用的输入 Token。本站仅对 Claude 模型提供缓存创建价格配置。
有相同的输入不代表一定命中缓存。是否创建或读取缓存取决于上游和模型,本站不会根据内容相似度猜测命中。
价格在哪里看
模型广场按所选分组展示输入、输出和缓存售价。价格单位通常是积分 / 1M Token,即每百万 Token。
缓存售价和普通输入售价都沿用模型的有效加价倍率:模型单独设置倍率时优先使用,否则使用总倍率,不把两种倍率相乘。
管理员没有填写缓存价格时,按普通输入价计算;明确填写 0 表示该项免费。不同分组的缓存价格可以不同。
费用怎么算
费用 = (普通输入 × 输入单价
+ 缓存读取 × 读取单价
+ 缓存创建 × 创建单价
+ 输出 × 输出单价) / 1000000如果输入总量已经包含缓存,需要先减去读取与创建量,得到普通输入。不能把总输入和缓存再重复计费。
Anthropic 返回的普通 input_tokens 通常不含缓存子集;本站会合并统计。OpenAI Chat / Responses 的总输入包含缓存子集,本站不会再次加上缓存量。
仪表盘的 Cache Hit Rate
缓存命中率 = 缓存读取 Token ÷ 全部输入 Token × 100%。全部输入包含普通输入、缓存读取和缓存创建,不包含输出。
例如全部输入 10000,其中读取 6000,命中率为 60%。没有输入的时段不显示百分比;整段时间先累加 Token 再计算,不直接平均各天百分比。
旧日志未记录缓存明细,无法补算过去的命中。上游没有报告缓存使用量时,也无法可靠推断。