Claude Code 官方教你把会话打得更值
拆解 Anthropic 2026-08-14 博文:输入输出计价差、prompt cache 何时失效、/model /effort /compact 的便宜时机。

Anthropic 在 2026-08-14 发了 Maximizing the value of your Claude Code sessions。订阅用户看不到逐 token 价,但扣额度的请求结构一样:历史几乎每轮整段重发,靠 cache 打折;你若在会话中途乱切模型或 effort,等于主动把前缀打成全价 prefill。
一笔小修复为何会有五次请求
官方例子:修一个失败测试。第一轮带上系统提示、CLAUDE.md 与你的话,全部 prefill 并写入 cache;随后 Read 测试文件、再 Read 被测文件、Edit、跑 npm test、最后摘要。每一轮都把「到目前为止的整段对话」再送出去,但只有新增的那一截按全价输入计,前面走约 0.1x 的 cache read。输出(含 thinking)大致按输入约 5 倍计价,effort 调的就是 thinking 量。
苦力活可在该会话设 MAX_THINKING_TOKENS=0(Fable 5 除外),等于比 /effort low 再下一档。开新会话时先跑一次 /model 与 /effort 确认当前默认,二者都会记住上次选择。
什么会把 cache 整段打废
请求前缀顺序固定:工具定义 → 系统提示 → 对话(CLAUDE.md 在对话前部)。改到前缀或改 cache key,后面全部重算:
/model(含 opusplan 进出 plan 换模)/effort- Fast mode(打开时按 fast 价重 prefill;关掉对 cache 相对友好)
/compact(对话被摘要替换,旧正文不再命中)- 时间:订阅约 1 小时、API key 约 5 分钟过期(
ENABLE_PROMPT_CACHING_1H=1可把 API 拉到 1 小时);隔太久再聊等于全量 prefill
便宜换模/换 effort 的时机:新会话开头,或刚 /clear 之后。长会话中途换,最贵。想丢掉最近几轮用 /rewind 裁尾巴,前面仍在 cache;不要用 /compact 当「后悔药」。
会话里什么最占坑
读过的文件、跑过的命令输出,之后每一轮都会再带上(cached 仍占上下文)。官方后文还强调:别为了「顺便」塞进大段无关日志。云端路径另有 Cloud Agent 省 token 可对照;本篇只管 Claude Code 本机会话账单结构。