CursorBench 3.1 模型性价比:Composer 2.5 为何偏离成本曲线

CursorBench 3.1 把模型得分和单任务均价画在一张图:越贵通常越高分,但 Composer 2.5 在约 63% 得分附近成本明显偏低。教你读图,也提醒这不是个人账单预测。

CursorBench 3.1:得分与单任务均价对比(含 Composer 2.5)

搜「Cursor 用哪个模型」时,排行榜只给半边真相:谁分高。官方最近一张 CursorBench 3.1 图把另一半也画出来了,纵轴是得分,横轴是单任务平均成本。读完你会发现,贵模型多数时候更强,但曲线右边有一个明显的偏离点:Composer 2.5

这篇只做一件事,教你怎么读这张性价比图,以及它和你每天在 Cursor 里切模型有什么关系。数字取图上的大致位置,用来比档位关系;具体美元会随定价和任务集变动,别当个人套餐报价来背。

先看懂坐标,再看点

  • 纵轴:CursorBench 3.1 得分,大致从约 30% 到 75%。
  • 横轴:Average cost per task。注意刻度是反的,左边贵(约 $20),右边便宜(靠近 $0),越往右越省钱,不是越贵。
  • 连线:同一模型家族在不同「努力/配置」下的轨迹(图例里的 high / medium default)。
  • 单点:个别模型只标一个工作点,例如 Composer 2.5Gemini 3.5 FlashKimi 2.6

误读横轴是最常见的坑:看到左边高分就以为「左边便宜」,其实左边多是「又贵又强」。

图上几条线各自在哪一档

按图上位置概括(都是约数)。Fable 5 high 在得分最高的一档(约 70%+),成本也最高,大约数美元到十几美元一个任务的量级,想冲上限时看它。Opus 4.8 high 是中上得分(大约五十多到六十出头),成本低于 Fable,仍明显高于最右端的廉价点。GPT-5.5 medium 在中段,成本压下去时得分下滑更明显,说明「省钱配置」会掉能力。Sonnet 4.6 high 在偏低分、偏低成本的区间,适合当「够用就行」的对照。Gemini 3.5 Flash 和 Kimi 2.6 落在更便宜、得分中等偏下的区域,偏吞吐和省钱。整体趋势很朴素,从左上到右下:愿意多花钱更能买到更高分,往右省钱,分数也跟着掉。

Composer 2.5:为什么看起来「离谱」

红色单点 Composer 2.5 大致落在得分约 63%、成本约 $1 一个任务的附近。同一得分高度上,左边的 Opus / GPT 系列要贵一截;同一成本高度上,右边多数点的得分又明显更低。

所以它不是「全场最高分」,而是这张图的性价比离群点:在中高分段里,把均价压得很低。这和「谁登顶 CursorBench」不是同一个问题,登顶看 Fable;问「日常 Agent 活能不能少花冤枉钱」,这张图把目光引向 Composer。

同站另有一篇讲 Agent 重建 SQLite 时,不同模型组合的总账单能差一个数量级,角度不同:那篇看重活编排,本文看基准上的得分乘均价。可对照 Cursor Agent 重建 SQLite 成本图怎么读

怎么验收:别只抄一个模型名

读完图后,用一周真实工作来验收,比再刷一张截图有用:

  1. 打开账户 Usage / 用量页,记下本周的任务类型(补丁、多文件功能、长 Agent)。
  2. 同类任务各跑一轮:中高配模型对比 Composer 2.5(或你当前的默认)。
  3. 验收三件事:一次通过率、你返工的次数、这个任务的花费。
  4. 若 Composer 在你的仓库里返工暴增,说明基准优势没迁移过来,关键路径换回更强的模型,别死磕榜单。

CursorBench 是官方任务集上的位置,不是你业务代码的 SLA。图解决的是「别只看分、也看钱」,最终仍要看你仓库里的 diff 质量。

日常选型怎么落

  • 探索、冲难题:需要上限时再上 Fable 一类高分段,并接受更高的均价。
  • 默认写代码、Agent 循环:优先试 Composer 这类「分够用、价更低」的点,用 Usage 验证。
  • 批量样板、简单问答:更便宜的 Flash 或中低分段就够,关键合并前再用强模型扫一眼。
  • 别全程顶配:图上 GPT/Opus 往右压成本时分数会掉,说明「同一家族省钱」也有能力税,与其偷偷降配,不如显式换一个用途匹配的模型。

模型怎么按场景切,同站还有更偏清单的说明:Cursor 模型怎么选

别把这张图讲成什么

  • 不是「Composer 全面碾压」。最高分仍在更贵的系列,离群的是性价比,不是绝对能力的天花板。
  • 不是个人账单预测。横轴是基准任务的均价,你的提示词长度、工具调用次数、是否开 Max 模式,都会改写真实花费。
  • 不是永久排名。换 CursorBench 版本、换定价、换默认配置,点的位置都会动。

适合怎么讲,别怎么吹

适合转发的说法:看模型别只看分,把「单任务均价」叠上去,Composer 2.5 才显得刺眼。

不适合当标题党的说法:别写成「最强且几乎免费」,图上最高分仍更贵,Composer 赢的是中高分段的性价比位置。

下一步,打开 Usage 做一周对照;要是关心重型 Agent 编排的账单,去读 SQLite 重建那篇成本拆解。