caveman skill 怎么省 token 机制与边界
caveman skill 怎么省 token?讲清它改输出话术不改上下文,65%与8.5%各是谁测的,以及装前怎么审 skill。

caveman skill 怎么省 token,靠的是让 Agent 用短句说话砍输出,上下文本身不被压缩。65% 是项目自报的聊天散文均值;Agent 写代码跑任务时,JetBrains 第三方测到约 8.5%。
Caveman 改的是说话方式
JuliusBrussee/caveman 把自己定位成 skill / plugin:装进 Claude Code、Cursor、Codex、Gemini 等 Agent 后,指示模型丢掉套话、用碎片句答,同时声明代码、命令、错误信息按字节原样保留。README 原话是 shrinks what the agent says, not what it knows。
机制落在系统提示层。安装脚本把 skill 文件丢进各 Agent 的技能目录;Claude Code 还可挂 hook,会话一开始就进入 caveman 模式。它不删你仓库、不截断上下文窗口、也不改 reasoning token。输入侧(你的提示、打开的文件、历史消息)长度不变;省的是模型吐出来的散文。
这点和「上下文压缩 / summarization」走的是两条路。压缩会改你塞进下一轮的材料;caveman 只改嘴。和 Skills 与 MCP 的分工 对齐时,它就是一条流程型 skill:描述进清单、触发后把短句规则注入,不额外起 MCP 连接。
65% 和 8.5% 分别谁测的
两个数字都真实,量的是不同负载。别把标语直接写进账单预期。
| 数字 | 负载 | 谁测的 | 口径 |
|---|---|---|---|
| 约 65% 输出减少 | 10 条聊天式散文提示 | 项目自报(Claude API 实计 token,benchmarks/ 可复现) |
相对默认啰嗦回复;区间约 22%–87% |
| 约 8.5% 输出减少 | SkillsBench 86 个编程任务 | JetBrains(2026-07,Claude Code + claude-sonnet-5) |
Agent 写代码跑测;质量与对照臂统计上难分 |
项目自己的 HONEST-NUMBERS.md 写得很直:技能不压缩输入;装上后每轮大约多带 1–1.5k 输入 token(SKILL.md 规则进上下文)。散文回复里叙述占大头,65% 才说得通;Agent 跑仓库时输出多是代码、diff、工具调用,短句只能挤中间那一层薄旁白,所以掉到个位数。
另外还有 /caveman-compress:把 CLAUDE.md 一类记忆文件改写成 caveman 体,README 表格自报平均约砍 46% 文件体积,之后每轮加载更小。那是输入侧手段,和「嘴小」主 skill 分开算。
哪些场景省得明显
HONEST-NUMBERS 给的经验阈值:常态回复输出经常超过约 1.5–2k token 时,省钱概率高;更短或按次计费时,容易净亏。
省得明显的常见负载:
- 解释与排错旁白:React 重渲染、auth 中间件、数据库竞态这类「讲清楚为什么」的长答。
- 架构讨论、文档草稿、调试 walkthrough:模型爱写完整段落,短句砍得狠。
- 长会话里啰嗦 Agent:每轮输出省一点会复利;技能固定开销相对平坦。
- 阅读速度:项目承认很多人真正赚的是读得快、等得少,账单只是附带。
和 Agent 别再浪费 token 里「脏上下文、重复带历史」是两条线:那边治输入膨胀,caveman 治输出废话。两边都做,才谈得上会话级省钱。若你主要在跑无人值守的改仓任务,先看下一节的个位数预期,再决定要不要默认开。
哪些场景伤可读性或白花钱
短句有代价。学习向讲解、给新人的走查、需要语气缓冲的代码评审,洞穴人体会显得冲、缺过渡,读者要自己补全逻辑。PR 评论收成 L42: bug: user null 一类时,信息密度高,协作语气和上下文交代会变薄。
账单上容易净亏的情况(项目文档与 issue 已写明):
- 本来就很短的编码问答:输出只省几十到一百 token,却每轮多付约 1k+ 输入开销(见仓库 issue #145)。
- 按请求 / 积分计费:例如按 premium request 扣的产品,答得短仍算一次请求,输出缩短不降额度。
- 个别 Agent 的计数异常:issue #550 提到有人在 Cursor 上 A/B 出现 caveman 一侧总 token 更高、墙钟更久;维护者未能复现同一跑法,但诚实建议是:你自己的 A/B 若呈净亏,关掉即可。
Agentic 账单往往被输入吃掉大半,纯输出技能天花板本来就低。这时更该看 子代理与模型分流省 token 一类输入侧策略,别只指望嘴巴变小。
装 skill 前怎么审
把 caveman 当「任意 curl | bash」之前,先过一遍仓库材料。
- 读机制文档:README「How it works」+
docs/HONEST-NUMBERS.md,确认你接受「只缩输出、每轮有输入开销」。 - 看安全与隐私:SECURITY.md 写明装完后无遥测、无后端;安装期会访问 GitHub 与各 Agent 注册源。确认脚本是否改你不认识的全局配置。
- 优先 dry-run / 单 Agent 安装:
INSTALL.md有 per-agent 路径与 dry-run;可用npx skills add JuliusBrussee/caveman -a cursor这类限定安装,避免一次扫全机。 - 核对等级:
lite/full(默认)/ultra/wenyan;中文工作流可先试lite,需要再加压。 - 准备关闭口令:说
normal mode或换回默认;Claude Code 上用/caveman-stats看会话估计值,最终对照供应商账单页做同任务开关 A/B。 - 划清职责边界:需要活数据、鉴权、写外部系统时上 MCP;caveman 只改话术,替代不了工具连接。
审完再装:你至少知道 65% 对应哪类负载、技能本身会加多少输入,以及关掉它只需一句口令。
和别的省 token 手段怎么分工
可以把省钱拆成三层,避免把 caveman 当成万能旋钮:
- 嘴(输出风格):caveman、团队自己的「少寒暄」规则。
- 脑外记忆与工具面:
/caveman-compress、精简CLAUDE.md、少挂常驻 MCP、检索别整文件灌上下文。 - 编排:简单子任务用便宜模型或专用 subagent,贵模型留给难决策。
Caveman 适合放在第一层做默认短嘴;第二、三层不动,会话总账仍可能难看。装之前用同一任务做开关对照,比相信任何标语都管用。项目维护者也在推 Caveman 2,想把「你这套栈上的真实收据」做成可核验面板;在那之前,账单页仍是最终裁判。