Cross-Model Cost Compare

描述一次真实的工作负载,看它在各个模型上分别要多少钱。 与多数计算器不同,这里把 prompt cache 的写入与读取分开计价—— 对反复读取同一份长上下文的 agent 场景,这个差别是数倍量级。

1 · 工作负载

2 · 结果

模型 缓存写入 缓存读取 新增输入 输出 合计 无缓存对照 vs 最便宜

3 · 为什么别的计算器会算错

把上面的可缓存上下文调大到 100000、命中率保持 90%,再看「合计」与「无缓存对照」两列的差距。

只有 input / output 两档的计算器,给出的是无缓存对照那一列。 对长上下文 agent 来说,它高估的不是几个百分点,而是几倍。

反过来也成立:这也是「tokens per dollar」作为效率指标失效的原因—— 缓存读取便宜十倍,反复读同一份上下文会让这个比值好看得离谱, 但你并没有因此多干成一件事。