Cursor 的 Grok 4.5:联训模型能干什么,别先信榜

cursor grok 4.5:Cursor 与 SpaceXAI 联合训练的重模型,训练数据含大量编辑器内交互,定位比 Composer 2.5 更宽。对照官方博文、CursorBench 污染说明,以及 SQLite 实验里约 $1,928 那根成本柱,再谈要不要改默认。

书桌水彩:笔记本模型下拉高亮 Grok 4.5,便签写联训与 Composer 分流

下拉里出现 Grok 4.5 那天,推荐帖比说明文来得快。有人直接叫「Cursor 迄今最强」,也有人已经在问:默认模型要不要从 Composer 全换过去。搜 cursor grok 4.5,更稳妥的做法是先看官方自己写了什么、又主动拿掉了哪项分数,再决定你仓库里的活跟不跟。

材料主要来自 cursor.com/cn/blog/grok-4-5(英文同文 /blog/grok-4-5)。价格、首周加倍、列表显示名都会变;下面碰到数字,以你打开当页的文案为准。

官方到底发布了什么

Cursor 与 SpaceXAI 一起推出 Grok 4.5,自称迄今最智能的一档,也是「首个不只面向软件工程构建」的模型。它面向高难度、跑得久、需要灵活用工具的任务,编程只是其中一块,博文还点到数据科学、金融、法律,以及你在电脑前做的其他知识工作。

训练侧有两个细节比口号管用:

  • 用了数万亿 token 量级的 Cursor 数据,覆盖人和代码库、工具、智能体怎么来回交互,不只是静态源码。
  • 比起 Composer 2.5「专精编程」的路线,Grok 4.5 的数据构成被故意加宽:STEM 题、论文和其他知识工作内容也加了进去。

他们还写了在真实环境里做强化学习:探索问题、调用工具、从错误里恢复、再确认结果。环境难到前沿模型也会失手,这句比空喊「最强」实在。桌面、Web、iOS、CLI、SDK 都写进了发布面;客户端里具体显示名以模型选择器为准,认准带 4.5 的那一项。

他们自己划掉的分数:CursorBench

横评截图最容易误导人。官方在同一篇博文里写明:Grok 4.5 在 CursorBench 上看起来很强,是因为 Cursor codebase 的一份较早快照被意外放进了训练数据;影响有多大他们也说不清,所以这项分数直接排除不计,并声明后续模型不会再用这批数据。

比起只喊「我们第一」,这段至少诚实。你要是在社交媒体看到「Grok 4.5 屠榜 CursorBench」再决定换默认模型,先回到博文这一段。SWE-Bench Pro、Terminal-Bench 等别家自报分,博文也做了来源标注,当热闹看可以,当选型依据偏软。

和 Composer 2.5:两档模型,别当成换皮

官方原话大意:Grok 4.5 与 Composer 2.5 是两种不同的模型权重级别,两边都会继续提供,这一档里的后续型号也还会出。落到日常选型:

  • Composer 2.5:为编辑器里写代码、改多文件练出来的。日常补丁、小步 Agent、要稳要快,我仍会先用它或 Auto。
  • Grok 4.5:更重、更宽,适合步骤长、工具来回多、还夹杂查阅或非纯代码决策的任务。博文甚至提了与网络安全能力匹配的额外防护,说明他们把它当成能力面更大的模型在管,不是换了个名字的补全引擎。

列表里若还有不带版本号的 Grok,别和 4.5 混谈。只想确认「Grok 这个名字能不能发出请求」,看 先回一句再谈选型;DeepSeek 并列怎么试,见 DeepSeek / Grok

钱要分三笔看:订阅用量、token 价、实验账单

个人和团队订阅里,Grok 4.5 算在第一方模型用量里,博文写过「大量用量」和首周翻倍,翻倍有截止日期(产品页曾写到 2026-07-21 前后),过了就别按活动价做长期预算。Usage 怎么读,见 用量页

博文同时给了计量向的两档:base 与 fast,百万 token 输入/输出单价不同。数字会改;需要报价时打开博文当页抄,别把转载里的表当成永久价目。

还有第三笔:官方 Agent 重建 SQLite 的成本图里,Grok 4.5 单柱大约 $1,928(同组里 Opus+Composer 更低,有的组合上万)。那是他们重型实验的账单,读法见 模型组合成本差 15 倍。它说明「重模型 + 长 Agent」可以很贵,却推不出你改个登录页也要两千刀。

我什么时候会改用 Grok 4.5

没有「全面升级」这种好事。我自己的粗规则:

  1. 任务本身就长。要跨很多文件、中间还得跑命令、读失败日志再改,值得拿 4.5 和现在的默认各跑一轮,比看别人晒的 diff 有用。
  2. 活不只是写代码。比如先理清一份半结构化需求、对照文档做方案、再落代码,这更贴近他们加宽训练数据的说法;纯改命名、调样式,没必要上这档。
  3. 先确认通道。选中带 4.5 的项,发 只回 ok。若出现 This model provider doesn't serve your region,别先卸客户端:产品页写过按 EU AI Act 欧盟暂不可用,其他地区也会撞上供应商区域限制,见 区域不可用。下拉选模型和自己填 Key 是两条线,别一起改;BYOK 见 自定义 API

对照时只看三件事:延迟能不能忍、有没有改到没点名的路径、边界有没有漏。看一周 Usage,比收藏一条「最强」转发靠谱。

我会认真试 Grok 4.5,主要是因为联合训练用了大量编辑器里的真实交互,以及官方肯把 CursorBench 污染写进博文。默认换不换,仍拿你正在改的那个仓库试:同一任务,4.5 和 Composer 各跑一遍,看 Usage 和 diff 就够了。