账单常见问题
理解为什么同一次操作会产生多条账单记录、缓存读写费用和折扣差异。
打开“用量日志”或“账单中心”的“额度明细”时,你可能会看到一些和直觉不完全一致的记录。这里整理了最常见的几个问题。
为什么我只发了一条消息,账单里却有多条记录?
这是正常现象。很多 Agent 工具并不是“一条用户消息 = 一次模型请求”。
例如 Claude Code、Codex 这类终端或桌面 Agent 工具,在完成一个任务时可能会连续发起多轮模型请求:理解需求、读取上下文、调用工具、总结结果、继续规划下一步。
此外,有些工具还会在你没有明确发送新消息时自动发起一些辅助请求,例如:
- 生成会话标题或摘要。
- 加载或压缩上下文。
- 检查当前会话状态。
- 为下一步操作做预处理。
“用量日志”展示的是底层真实发生的模型请求,所以你可能会在同一时间附近看到多条记录。
简单理解:你看到的是一次操作或一次对话,系统记录的是背后所有真实发生的模型调用。
为什么我选的是某个模型,账单里却出现了另一个模型?
Agent 工具可能会把一个任务拆成多个步骤,不同步骤使用不同模型,例如用更强的模型做规划,再用更轻量的模型处理简单内容或做摘要。
所以同一轮任务中出现多个模型(例如 gpt-5.5 和 gpt-5.4-mini)不一定代表异常,而是工具在按步骤调用不同模型。可以在“用量日志”中查看每条记录实际使用的模型。
缓存读取和缓存写入是什么?为什么金额差异很大?
缓存读写是模型服务的上下文缓存机制。Agent 工具在连续多轮任务中经常会重复携带大量上下文,例如项目文件、历史对话、工具调用结果等。
- 缓存写入:首次把上下文写入缓存,单价通常高于普通输入。
- 缓存读取:后续复用已缓存的上下文,单价通常远低于重新输入。
所以你可能会看到某些记录缓存写入较多、费用较高,另一些记录缓存读取较多、费用较低,这通常说明工具在复用之前的上下文缓存。可以在“模型列表”中查看对应模型的缓存读取和缓存写入单价。
为什么有些请求输入 Tokens 很少,但费用不低?
因为计费不只看普通输入和输出 Tokens,还可能包含缓存写入、缓存读取和模型本身的单价差异。
尤其是 Claude 系列模型和 Agent 场景中,大量费用可能来自上下文缓存写入,而不是你本次手动输入的那几句话。
为什么同一个模型,费用却不一样?
账单费用是按请求实际使用的渠道分组和模型折扣计算的,不是固定不变的标准价格。
“模型列表”会显示渠道分组“低至 X折”和每个模型自己的实际折扣。智能路由 Key 在不同时间可能命中折扣力度不同的渠道分组,所以同一个模型在不同请求中的费用可能不完全一致。可以在“用量日志”中查看每条请求实际使用的渠道分组,再到“模型列表”核对当时的折扣。
为什么感觉消耗越来越快?如何减少额度消耗
感觉消耗越来越快通常有几种原因:
- 在同一个会话里持续对话时,工具通常会把更多历史消息、文件内容、工具结果一起带给模型,单次请求的上下文会变长,因此体感上每次消耗会越来越高。建议长对话后适当开启新会话或压缩上下文;只是简单问题时,可以选择更轻量的模型以降低单次消耗。
- 如果在一个会话里频繁切换完全不同的任务,例如先分析代码、再处理图片、再写文案,新的问题会不断引入不同的上下文,导致原本可复用的缓存被重写或命中率下降。建议把不同类型的任务拆到不同会话里处理,更有利于缓存复用。
什么时候需要联系客服
如果遇到以下情况,可以联系我们排查:
- 明显没有发起任务,但账单持续产生记录。
- 短时间内多次重复缓存写入,且没有缓存读取。
- 同一请求出现异常大量重复扣费。
- 账单中的模型与你的实际使用场景完全不符。
- 扣费金额明显异常。
- Agent 调用失败,但仍产生了无法理解的扣费记录。
在控制台侧边栏点击“联系客服”打开在线支持,并尽量提供请求时间、模型名称、渠道分组和截图,方便我们快速定位。