CursorBench 3.1 模型性价比:Composer 2.5 为何偏离成本曲线
CursorBench 3.1 把模型得分和单任务均价画在一张图:越贵通常越高分,但 Composer 2.5 在约 63% 得分附近成本明显偏低。教你读图,也提醒这不是个人账单预测。

搜「Cursor 用哪个模型」时,排行榜只给半边真相:谁分高。官方最近一张 CursorBench 3.1 图把另一半也画出来了,纵轴是得分,横轴是单任务平均成本。读完你会发现,贵模型多数时候更强,但曲线右边有一个明显的偏离点:Composer 2.5。
这篇只做一件事,教你怎么读这张性价比图,以及它和你每天在 Cursor 里切模型有什么关系。数字取图上的大致位置,用来比档位关系;具体美元会随定价和任务集变动,别当个人套餐报价来背。
先看懂坐标,再看点
- 纵轴:CursorBench 3.1 得分,大致从约 30% 到 75%。
- 横轴:Average cost per task。注意刻度是反的,左边贵(约 $20),右边便宜(靠近 $0),越往右越省钱,不是越贵。
- 连线:同一模型家族在不同「努力/配置」下的轨迹(图例里的 high / medium default)。
- 单点:个别模型只标一个工作点,例如
Composer 2.5、Gemini 3.5 Flash、Kimi 2.6。
误读横轴是最常见的坑:看到左边高分就以为「左边便宜」,其实左边多是「又贵又强」。
图上几条线各自在哪一档
按图上位置概括(都是约数)。Fable 5 high 在得分最高的一档(约 70%+),成本也最高,大约数美元到十几美元一个任务的量级,想冲上限时看它。Opus 4.8 high 是中上得分(大约五十多到六十出头),成本低于 Fable,仍明显高于最右端的廉价点。GPT-5.5 medium 在中段,成本压下去时得分下滑更明显,说明「省钱配置」会掉能力。Sonnet 4.6 high 在偏低分、偏低成本的区间,适合当「够用就行」的对照。Gemini 3.5 Flash 和 Kimi 2.6 落在更便宜、得分中等偏下的区域,偏吞吐和省钱。整体趋势很朴素,从左上到右下:愿意多花钱更能买到更高分,往右省钱,分数也跟着掉。
Composer 2.5:为什么看起来「离谱」
红色单点 Composer 2.5 大致落在得分约 63%、成本约 $1 一个任务的附近。同一得分高度上,左边的 Opus / GPT 系列要贵一截;同一成本高度上,右边多数点的得分又明显更低。
所以它不是「全场最高分」,而是这张图的性价比离群点:在中高分段里,把均价压得很低。这和「谁登顶 CursorBench」不是同一个问题,登顶看 Fable;问「日常 Agent 活能不能少花冤枉钱」,这张图把目光引向 Composer。
同站另有一篇讲 Agent 重建 SQLite 时,不同模型组合的总账单能差一个数量级,角度不同:那篇看重活编排,本文看基准上的得分乘均价。可对照 Cursor Agent 重建 SQLite 成本图怎么读。
怎么验收:别只抄一个模型名
读完图后,用一周真实工作来验收,比再刷一张截图有用:
- 打开账户
Usage/ 用量页,记下本周的任务类型(补丁、多文件功能、长 Agent)。 - 同类任务各跑一轮:中高配模型对比
Composer 2.5(或你当前的默认)。 - 验收三件事:一次通过率、你返工的次数、这个任务的花费。
- 若 Composer 在你的仓库里返工暴增,说明基准优势没迁移过来,关键路径换回更强的模型,别死磕榜单。
CursorBench 是官方任务集上的位置,不是你业务代码的 SLA。图解决的是「别只看分、也看钱」,最终仍要看你仓库里的 diff 质量。
日常选型怎么落
- 探索、冲难题:需要上限时再上 Fable 一类高分段,并接受更高的均价。
- 默认写代码、Agent 循环:优先试 Composer 这类「分够用、价更低」的点,用 Usage 验证。
- 批量样板、简单问答:更便宜的 Flash 或中低分段就够,关键合并前再用强模型扫一眼。
- 别全程顶配:图上 GPT/Opus 往右压成本时分数会掉,说明「同一家族省钱」也有能力税,与其偷偷降配,不如显式换一个用途匹配的模型。
模型怎么按场景切,同站还有更偏清单的说明:Cursor 模型怎么选。
别把这张图讲成什么
- 不是「Composer 全面碾压」。最高分仍在更贵的系列,离群的是性价比,不是绝对能力的天花板。
- 不是个人账单预测。横轴是基准任务的均价,你的提示词长度、工具调用次数、是否开 Max 模式,都会改写真实花费。
- 不是永久排名。换 CursorBench 版本、换定价、换默认配置,点的位置都会动。
适合怎么讲,别怎么吹
适合转发的说法:看模型别只看分,把「单任务均价」叠上去,Composer 2.5 才显得刺眼。
不适合当标题党的说法:别写成「最强且几乎免费」,图上最高分仍更贵,Composer 赢的是中高分段的性价比位置。
下一步,打开 Usage 做一周对照;要是关心重型 Agent 编排的账单,去读 SQLite 重建那篇成本拆解。