Cursor Grok 4.5 值得用吗 怎么自己验一遍
Cursor Grok 4.5 值得用吗?拆开官方自报跑分、effort 档位和额度口径,说清哪些任务派给它、哪些别派,再给一套两小时自测方案。

Cursor Grok 4.5 值得用吗,取决于你手上是哪类活。官方口径是它擅长跑几小时的长任务,代价是每 token 比 Composer 贵。这篇把派活边界、额度口径和自测方法摆出来。
Grok 4.5 是 Cursor 自己训的模型
不少人以为它是从 xAI 接进来的第三方模型。官方说法是另一回事:Grok 4.5 由 Cursor 与 SpaceXAI 联合训练,底座是一个新的 mixture-of-experts 预训练模型,之后在数以万亿计的 Cursor 使用数据上继续训练,那批数据记录的是真实开发者与 agent 的交互,2026 年 7 月 8 日发布。
和 Composer 2.5 的区别在训练配比。Composer 2.5 专做代码,Grok 4.5 的配比被刻意放宽,掺进 STEM 任务、研究论文和其他知识工作,再在难到连前沿模型都会失手的问题上做强化学习。官方定位是「不止于软件工程」,覆盖数据科学、金融、法律这类活。
发布时旧版 Grok 模型全部废弃;此前在企业后台屏蔽过 SpaceXAI 或 Composer 系列的团队,要先手动放开 Grok 4.5 成员才选得到。它在桌面端、Web、iOS、CLI、SDK 和 Automations 里都能用。
官方跑分只能当参考起点
下面四组数字全部来自 Cursor 官方模型页,是厂商自己发布的对比。读之前先注意一件事:这四项里 Grok 4.5 没有一项排第一。
| 评测 | Grok 4.5 | Opus 4.8 | GPT-5.5 | Fable 5 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 83.3% | 78.9% | 83.4% | 84.3% |
| SWE-Bench Multilingual | 78.0% | 84.4% | 77.8% | 未列 |
| SWE-Bench Pro | 64.7% | 69.2% | 58.6% | 80.3% |
| DeepSWE 1.0 | 62.0% | 55.8% | 64.3% | 66.1% |
页面脚注把水分说得很清楚:SWE-Bench Pro 和 Terminal-Bench 里第三方模型的分数是各家自报,GPT-5.5 的 SWE-Bench Multilingual 来自 Cursor 内部跑测。三种来源混在一张表里,横向比只能看个大概。
更值得一提的是 Cursor 自曝的一处污染:Grok 4.5 在 CursorBench 上有优势,因为一份早期的 Cursor 代码库快照被误纳入训练数据,影响多大官方称尚不清楚,这项成绩因此被排除。这种自曝在厂商发布里少见,但恰好说明单一榜单撑不起选型判断,Opus 5 与 Sonnet 4 的评测对比也是同样的问题。
官方还有一条效率主张:完成多步任务所用步数不到同级前沿模型的一半,CursorBench 3.2 上的记录是每任务 33 步、19,521 tokens、$1.51,得分 66.7%。步数直接关系到账单,比准确率更值得在自己仓库上验一次。
哪些任务派给它,哪些别派
Grok 4.5 是 Cursor 第一个带 effort 档位的模型,high 是默认,另有 medium 和 low,档位越高思考越久、输出 token 越多,Composer 没有这个概念。这个设计本身就暗示了适用面:值得让模型多想的活才配用它。
官方点名的强项是长周期任务:大型迁移、跨多个服务的改动、需要读代码库和跨文件编辑、跑测试、失败后接着改直到补丁站得住的那种。研究调查类也算,多步搜索加综合后交一份成品。
反过来,日常小改别派。官方建议很直接:追求速度和成本的日常编码选 Composer,而且 Composer Fast 比 Grok 4.5 Fast 更快。单文件改个判断、补个类型、调格式这类活,用贵模型换不来质量差异。分界线是这任务需不需要模型多轮试错,需要就给 high,只执行一条明确指令就交给便宜的。
额度和账单是怎么算的
标准档 $2/M 输入、$6/M 输出、$0.50/M 缓存读取;Fast 档 $4/M 输入、$18/M 输出、$1.00/M 缓存读取。输出侧两档差三倍,而 high effort 恰恰推高输出 token,两个因素叠起来账单涨得比想象快。作为参照,Composer 2.5 的 Fast 变体是 $3/M 输入、$15/M 输出。
套餐这边分两个池子:Cursor Models 池装 Grok 4.5 和 Composer 2.5,Other Models 池装第三方模型、按各家 API 价计。Pro($20/月)含 $20 的 API agent 用量加一份 first-party 池额度,Pro+($60/月)含 $70,Ultra($200/月)含 $400。用量按账单周期每月重置不结转,超出后开按需付费或升套餐。
还有两条要留意。发布首周的双倍用量到 2026 年 7 月 21 日为止,现在已经结束,按当下消耗速度估算才准。印度的 Start 套餐上 Grok 4.5 固定在 medium effort、非 Fast 模式,档位和 Fast 都锁死,要解锁得升到 Pro 以上。
和 Composer、Auto 是什么关系
Auto 现在由 Cursor Router 驱动,路由池里有五个模型:Composer 2.5、GPT-5.5、Claude Opus 5、Grok 4.5、Claude Fable 5。Grok 4.5 是其中的必需项,团队若把它屏蔽,整个 Router 会直接停用,理由是路由需要一个既强又便宜的模型兜底。
Router 有三档优化方向。Cost 就是老版 Auto,保留原来的打包计价;Balance 是新用户默认;Intelligence 走更强的模型,官方称质量高出约 20% 到 30%。后两档按被路由到的模型价格计费。从 SDK 调用时模型 id 是 auto-smart,参数 optimize_for 取 cost、balanced 或 intelligence。
有个实操细节容易吃亏:默认情况下 Router 路由到哪个模型是隐藏的,团队管理员可在后台改成显示。做模型对比前必须打开它,否则你不知道刚才那次是谁跑的。手动选型和 Auto 的取舍可以看怎么在 Cursor 里切换模型和用 Router 压低单次成本。
用自己的仓库两小时验一遍
固定五到八个任务、固定一个 commit、固定 effort 档位,这三条定死结果才有可比性。任务清单建议这样配:一个跨文件重构、一个带失败测试的 bug、一个新增接口、一个依赖升级、一个纯代码理解问答。都从同一状态起跑:
git worktree add ../bench-grok45 <commit-sha>
git worktree add ../bench-composer <commit-sha>
每个任务记四个数:一次通过还是要返工、返工轮数、墙钟耗时、花了多少钱。前三个自己掐表,花费去 Spending 面板看,那里有按请求的实时用量和剩余额度。返工轮数往往比准确率更能说明问题,「答案对但要你纠正三次」的实际成本远高于账单数字。
三个会让结果失真的坑。一是别用 Auto 做对照组,它每次路由到的模型可能不同,样本不同源。二是每个任务开新会话,上下文残留会让后跑的模型白捡便宜。三是 effort 别中途改,默认 high 就全程 high。跑完你手上会有一张自己仓库上的表,比厂商跑分更能回答该不该换。
国内可用性只有这些能确认
官方帮助页说 Grok 4.5 在 Cursor 正常提供模型的所有国家都可用。同一时间 cursor.com/grok 的 FAQ 里仍留着「尚未在欧盟提供」,而论坛发布公告已经把「未来几周登陆欧盟」改成了「现已全球可用」。两处口径不一致,实际能不能选到要看产品内的模型列表。
官方对「模型不可用」的解释是:部分模型因提供方(不是 Cursor)设置的地区限制而不出现在列表里。三条绕法分别是改用 Auto(声明全地区可用)、换一家限制更松的提供方、或在 Cursor Settings 的 Models 里填自己的 API key,官方也提醒即便自带 key,提供方仍可能拒绝该地区请求。
国内网络能不能稳定连上、订阅能不能顺利付款,都不在官方文档覆盖范围内,需要自行验证。