比较 API 价格时,不能只看充值金额或一个倍率。先确认使用的模型、分组、输入和输出单价、缓存规则,再用真实请求记录核对。本文解释核对方法;当前实际价格请查看模型与分组页面及账户显示。
输入、输出和缓存分别是什么
- 输入:发给模型的提示词、系统说明、历史对话以及工具结果等。
- 输出:模型生成的内容;具体模型可能还有其他计费项目。
- 缓存读取:复用已缓存的输入,是否命中由模型及上游实际结果决定。
- 缓存写入:部分模型单列的缓存创建成本,不能与缓存读取混为一谈。
Token 不是固定数量的汉字。历史对话增长、重复携带大段工具输出,都可能让后续请求的输入量增加。
用一个假设例子理解计算
以下仅为计算示例,不是本站报价:假设输入单价为每百万 Token 10 元,输出单价为每百万 Token 30 元;某次请求普通输入 1000 Token、输出 200 Token,且没有缓存或其他计费项,则基础费用为:
1000 ÷ 1,000,000 × 10 + 200 ÷ 1,000,000 × 30 = 0.016 元若展示的是基础价且另有分组倍率,还需按本站规则计算倍率;若已经是最终价,不要再乘一次。账户余额显示单位、充值实付金额与模型定价货币也应分别核对。
缓存为什么容易算重
部分接口的总输入字段已经包含缓存读取量,另一些接口会单列缓存。不能一边按全部输入收费,一边不加区分地叠加缓存。核对时以本站请求明细的分类用量和计费结果为依据,保留请求时间、模型、分组与请求 ID,便于定位。
如何检查一次扣费
- 记录调用前余额,确认密钥分组和模型。
- 发起一次输出受限的小请求,期间避免其他任务并发使用同一密钥。
- 打开密钥用量查询或登录后的用量页,对照输入、输出、缓存、费用与时间。
- 有疑问时提供脱敏记录,不要发送完整 API Key。
控制开销的几个方法
给每个应用使用独立密钥;在业务中设定输出上限和并发上限;只重试可恢复错误,并限制次数。网络中断不必然意味着请求没有执行,重试前应核查用量。模型是否适合业务,应与价格一起通过小规模实际请求判断。