Cursor 称长任务花费降了 7%

2026 年 9 月 23 日 Cursor 研究博客称,调整 agent harness 后用户 token 花费降了 7%,质量没有下降。系统提示大约削掉 66%,内置工具的静态描述 token 降了 60%。这是厂商测量,账单不会自动少 7%。

Cursor 称长任务花费降了 7%

2026 年 9 月 23 日,Cursor 研究博客写:过去几个月改了 agent harness 之后,用户的 token 花费降了 7%,agent 质量没有下降。cursor agent 花费降了多少,官方给的总数字就是这一个。博客没有公开任务集、账号样本,也没有写 7% 是输入、输出还是账单金额。把它当成你下个月发票的折扣,读过了头。

作者:CodePass 技术编辑

7% 下面的几层改动

作者是 Jediah Katz、Connor O'Keefe 和 Calvin Yee。他们把花费拆在自己能控制的上下文上。

系统提示大约削掉 66%。模型变强之后,工具用法、任务管理和改代码流程不再用长串禁止句来写,改成定义工具行为。他们注明:新模型仍会加减指令,并用大规模 A/B 看真实流量,评测集偏难题,不能代表用户请求的分布。

内置工具的完整定义不再每次都塞进请求。多数工具在不到 20% 的对话里才会用到。静态上下文里留下高频的读、搜、改和 shell,另外留下 ask_question(有的模型会幻觉调用它)和 Plan 模式里的 create_plan。其余工具在需要时再加载。静态上下文里的描述 token 因此降了 60%。更早把 MCP 工具改成动态加载时,在调用过 MCP 工具的会话里,总 token 降了 46.9%。46.9% 的分母是那些会话,不是全部流量。

缓存:从 GPT-5.6 起,OpenAI API 允许显式缓存断点。他们把断点放在稳定层之后、增长中的对话之前,并把技能、子 agent 和环境信息挪到断点之后的 phantom user message。冷缓存未命中率降了 20%。读文件时,行号从每一行改成每十行一个,缓存读取 token 降了 1.6%。单个行号大约三到五个 token,长会话里才积出来。

子 agent:他们去掉了强烈鼓励用子 agent 做代码库探索的指令,并收紧选模型的参数,只有用户或 harness 指示时才换模型。博客没有给这一层单独的百分比。

和 8 月那组云端数字分开

8 月前后有过另一组厂商说法:Cloud Agents 大约省 20% 到 30% token,带 computer use 大约省 80%。那组没有公开测试方法,见 云端 agent 怎么省 token。9 月 23 日这篇的 7% 是 harness 组装方式,比较对象是改 harness 前后的生产花费,不是「云端对比本地」也不是「开了 computer use」。两篇百分比不能相加。

博客末尾写,同样的经验正在用到 Grok Bot 的 harness。那句话没有给出 Grok Bot 的降幅。

参考资料