Cursor Agent 重建 SQLite:模型组合成本差 15 倍,怎么读这张图
Cursor 用 Agent 团队按 835 页手册把 SQLite 用 Rust 重做并通过留出测试。官方成本图显示不同模型组合最多差约 15 倍——本文拆开 Planner/Worker,顺带讲清模型选不了时怎么排查,并给出日常选型建议。

Cursor 官方前阵子晒了一组实验:让一队 Agent 对着 SQLite 那本约 835 页的手册,用 Rust 重做一份副本,并在留出(held-out)测试集上拿到 100% 通过。真正扎眼的不是「AI 又写了个大项目」,而是旁边那张成本图:同一个任务,只换模型组合,账单能差到大约 15 倍。
对每天写业务代码的人来说,这张图的价值不在于你也要去重写数据库,而在于它把一件容易被忽略的事摊开了:模型贵不贵,很多时候取决于你怎么拆角色、怎么组队,别只盯着排行榜第一名。
实验在比什么
- 任务:按手册规格重建 SQLite,用 Rust 实现。
- 验收:留出测试套件全过,比「看起来能跑」硬一档。
- 变量:不同 model mix;成本拆成 Planner(灰)和 Worker(橙)两截。
- 倾向:组合与编排会明显影响总花费,带 Composer 的搭配在这张图里更省。
带 * 的柱子官方注明是 informal run,用于成本校准,不算受控对比的一部分。读图时别把标星数据和正式对比柱混为一谈。
这张成本图怎么读
官方图里几档大致是这样(单位美元,取柱顶标注):
- Opus 4.8 + Composer 2.5:约 $1,339,这组里最低
- Grok 4.5:约 $1,928
- Fable 5 + Composer 2.5:约 $2,234
- Opus 4.8*:约 $5,153,非正式
- GPT 5.5:约 $10,565
- Fable 5*:约 $20,057,非正式,最高
最低和最高一比,差不多就是官方说的 15 倍量级。得先说死一件事:这是他们那次重建 SQLite 的账单,不是你在本地改个登录页也要花两千刀。数字用来看档位关系,别直接当成个人套餐报价。
Planner 和 Worker,钱花在哪一截
柱子拆成两截很关键:
- Planner:拆任务、定边界、排步骤,偏「动手前先想清楚」。
- Worker:真正写代码、改文件、跑迭代,常占大头。
贵的组合里,橙色 Worker 那截经常被拉得特别长:执行阶段反复试错,上下文越堆越长,费用就有种指数往上窜的感觉。更省的组合并不是「完全不规划」,而是规划够用、执行更克制,没让 Worker 在那空转。
这也解释了图里那个反常的地方:强模型单打,不一定打得过强模型 + Composer。编排层要是能砍掉大量无效 Worker 回合,总账能直接低一个数量级。会不会组队,有时候比再买一个更贵的单模型还管用。
日常怎么用这套逻辑
你大概率不会去复现 SQLite,但这套逻辑可以直接变成习惯:
- 别默认全程顶配。排错、读栈、改单文件,中上档模型就够;多文件大改再上更强档。
- 先把任务切小。官方用 Agent 团队,你这边的等价物是一次只交一个可验收的小目标,而不是「把模块重构完」。
- 让规划便宜又清楚。用一小段 Rules 或验收标准当 Planner,减少 Worker 瞎改,这一步几乎不花钱。
- 看 Usage,别看感觉。某周账单陡增,先查是不是 Agent 在无关目录空转,再决定换不换模型。
一句话,任务决定用哪档模型,额度只决定你能试几次。可读:Cursor 模型怎么选、Agent / Rules 工作流。
想换更省的模型,却选不了、发不出?
聊完贵不贵,还有个更常见的卡点:模型明明列在下拉里,选中一发送却弹 This model provider doesn't serve your region,或者干脆灰着点不动。先在下拉选中目标模型,发一句最短的话(比如「回个 ok」),三种结果对应三条路:
- 报 region / model not available,是区域问题,别卸载重装,先切 Auto 顶一下,细节见区域不可用排查。
- 能回但连发几条后转圈限速,更像套餐额度,打开 Usage 看一眼。
- 直接灰掉选不了,看当前套餐是否包含该模型。
DeepSeek、Grok 具体给不给、怎么算额度,以你打开定价页当天的文案为准,别信半年前的截图;更细的选型见 在 Cursor 里用 DeepSeek / Grok。
读图时别混进这些结论
- 不是「某个模型永远最便宜」。换任务、换测试集、换提示词,排序都会重排。
- 不是「上了 Composer 就免费」。图里最省的组合也要一千刀量级,那是重型工程实验,不是日常报价。
- 100% 测试通过 ≠ 生产可替换 SQLite。留出测试很硬,但真实数据库还有生态、扩展、性能与运维;把它当成 Agent 能力上限的展示,而不是迁移指南。
用自己的仓库比一周
所有横评帖都替代不了一件事:拿你正在写的这个仓库,让两三个候选模型各跑一遍同一个需求,然后看三点,谁的延迟你能忍,谁没乱改你没让它碰的文件,谁把边界情况也顺手处理了。
务实组合可以长这样:日常问答和小补丁用性价比模型或 Auto;多文件功能用更强模型 + 小步提交 + 人审 diff;大批量样板先用便宜模型铺,关键路径再换强模型复核。
回到那张成本图,它真正想提醒的不是让你去背哪个组合便宜,而是那句藏在两截颜色里的话:Agent 干重活时,怎么拆角色、怎么组队,有时比多花钱买一个更贵的单模型更能打。至于你的项目该配什么,最靠谱的答案不在图上,在账户 Usage 里,对着真实任务跑一周,它自己会告诉你;审 diff 仍然是你的事。