Cross-Model Cost Compare
描述一次真实的工作负载,看它在各个模型上分别要多少钱。 与多数计算器不同,这里把
prompt cache 的写入与读取分开计价
—— 对反复读取同一份长上下文的 agent 场景,这个差别是数倍量级。
1 · 工作负载
可缓存的上下文(token / 轮)
系统提示词、工具定义、CLAUDE.md、固定参考文件——每轮不变的那部分
每轮新增输入(token)
你的新消息、工具返回结果——每轮都不同,无法缓存
每轮输出(token)
含推理 token(若模型计费包含)
总轮数
一次会话内的来回次数
缓存命中率:
90%
拖到 0% 看「没有缓存纪律」的世界长什么样——这是最能说明问题的一次拖动。
规模放大(会话数)
填 1 看单次会话;填 176 约等于一个人一个月(每天 8 个会话 × 22 天)
2 · 结果
模型
缓存写入
缓存读取
新增输入
输出
合计
无缓存对照
vs 最便宜
3 · 为什么别的计算器会算错
把上面的
可缓存上下文
调大到 100000、命中率保持 90%,再看「合计」与「无缓存对照」两列的差距。
只有 input / output 两档的计算器,给出的是
无缓存对照
那一列。 对长上下文 agent 来说,它高估的不是几个百分点,而是几倍。
反过来也成立:
这也是「tokens per dollar」作为效率指标失效的原因
—— 缓存读取便宜十倍,反复读同一份上下文会让这个比值好看得离谱, 但你并没有因此多干成一件事。