Grok 4.6 跑分怎么看:厂商自报读法

SpaceXAI 自报 AA 61、CursorBench 69.9%、GDPVal 1753、DeepSWE 65.9% 怎么读,和 DeepSeek 跑分文意图不同。

Grok 4.6 跑分怎么看:厂商自报读法

grok 4.6 跑分怎么看:2026-08-12 SpaceXAI 通稿附 Evals 表,AA Intelligence Index 61、GDPVal-AA 1753、CursorBench 3.2 69.9%、DeepSWE 1.1 65.9%、FrontierCode 1.1 61.3%。表脚写明第三方分多为自报或公开最优,读法应是厂商对照快照,不是替你仓库写的验收标准。

作者CodePass 技术编辑

通稿表在比什么

x.ai/news/grok-4-6 Evals 段把 Grok 4.6 High 与 4.5 High、GPT-5.6 Sol Max、Fable 5 Max 并列。摘五项中文读者最常搜的:

基准 Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 61.3% 56.6% 60.6% 63.6%

脚注:「Best score per evaluation in bold. Third-party model scores are the best of self-reported or publicly available results.」 competitor 图也注明来自各开发者 system card 或 leaderboard。横向谁第一,取决于是否同一 harness、同一 effort、是否 Fast。

AA Index 是九项合成;通稿称 4.6 与 GPT-5.6 Sol Max 同为 61,Fable 5 Max 略高 62。叙事是同级前沿,不是全面碾压。通稿另列 Terminal-Bench v3.0:4.6 26%,Sol Max 34.6%,说明终端多步 shell 并非 4.6 强项,不能只看 CursorBench 一列选型。

厂商自报水分从哪来

读 4.6 表要带三类风险,和 Grok 4.5 值不值 里 Cursor 自曝 CursorBench 训练污染是同一类问题:

Harness 不可复现:effort、工具集、温度、是否 Fast,决定分和你在 IDE 默认档是否同分布。官方 Evals 行标注 Grok 4.6 High,你在 Pro 上默认 Fast 加 high effort,分布可能不同。

CursorBench 与 Cursor 产品亲缘:名字暗示评测贴近 Cursor agent 路径,联训模型有主场优势。4.5 时代官方曾承认早期 Cursor 代码库快照污染疑云,4.6 通稿未重复披露,仍不能当独立第三方审计。

对手行也是公开最优:GPT、Fable 列不是 SpaceXAI 实验室同场并跑,是摘各家自报最大值。DeepSWE 65.9% 对 4.5 的 54% 涨幅大,但 Sol Max 通稿写 73%,4.6 并未夺魁。

和「抗污染榜落差」文的分工

若你关心的是同一模型在静态榜与抗污染榜差几个数量级,那是 DeepSeek V4 0731 一类故事的读法,本文不重复 CAISI/Datacurve 叙事。SpaceXAI 这次给的是联训 agent 对照表,核心疑问是 Cursor 池模型是否值得从 4.5 升级,以及相对 Sol/Fable 的位置。读表时把「厂商自报」标签贴在每一列上,比争论绝对分数更有用。

Grok 4.6 文应先看表内 4.6 对 4.5 的涨幅(CursorBench +3.2pt、DeepSWE +11.9pt、FrontierCode +4.7pt),再落到自己仓库实测。厂商表是选型起点,不是 SLA;别用 AA 61 一句替掉两小时对照实验。若采购方要求第三方审计,应单独索要独立实验室在同 harness 下的复跑报告,SpaceXAI 通稿脚注已声明 competitor 分来源,不能当作并跑证书。

单项基准怎么落到选型

GDPVal-AA(1753)偏知识工作综合;FrontierCode 偏扩展代码任务。写码若只看 CursorBench 69.9%,要同时看 DeepSWE 与 Terminal-Bench:通稿里 4.6 在后者并不领先。官方 GA 文强调长 agent 与视觉首稿,benchmark 强项分布应和这类叙事交叉验证,不能挑一列写营销。APEX-SWE、Terminal-Bench 等列在通稿里差距更大时,说明「编码 agent 全能」叙事不成立,应按任务类型选模型而非选最高分。

Cursor Grok 4.6 灰度核实 回答账号有没有 4.6;Evals 表只回答官方宣称 intelligence 层级。两问题独立:没 GA 的账号跑不出 4.6 分,有 GA 也不代表你仓库能复现 69.9%。Fable 5 Max 在 CursorBench 通稿行 70.5% 高于 4.6,若场景极度依赖该 benchmark 排名,升级 4.6 不等于自动超过 Fable,仍要看任务类型与 effort。媒体转述「平 GPT-5.6 Sol」时,应同时转述 Terminal-Bench 等弱项,避免采购只看 headline。

一小时仓库验分法

把厂商表换成可执行检查:

  1. 固定 commit,4.5 high 与 4.6 high 各跑同一 SWE 型 bug(含测试)。
  2. 加一条 UI 小页任务,看首稿可用度(对齐官方视觉首稿叙事)。
  3. 记录返工轮数、Spending token、是否误改无关文件。
  4. 只保留返工少且账单可接受的一侧作 default。

别用 Auto 或 Router 对照,样本会混模型。GA 首周 2x included 适合放在实验窗口,但 promo 不改变「自报分必须自测」纪律。SpaceX 收购 Cursor 何时交割 提供联训背景,不改变评测方法。对照实验期间建议关闭无关 MCP 工具,避免工具调用噪声淹没模型差异;UI 任务与 SWE 任务分开记分,最后加权合成内部切换结论,比单列 AA 61 更贴近团队偏好。实验记录应保存 effort、Fast 或 Standard、会话 id 与 Spending 截图,方便日后复盘为何改 default。

Grok Bot 是什么 的关系:Bot 后端自动路由,IDE 里 4.6 跑分对照可复现;用 Bot 线程成绩反推 IDE 4.6 能力会混产品线。Engineering 选型以 IDE 显式选 4.6 的实验为准。Bot 侧若未来默认升到 4.6,也应单独发版说明,不能从 IDE Evals 表直接推断 Bot 线程质量。

通稿还列 APEX-Agents、AA-Briefcase 等知识工作向分数,和 GDPVal 同属「办公综合」类,与纯 SWE 榜单权重不同。若团队 KPI 是「少返工合并 PR」,优先 weigh DeepSWE、FrontierCode;若 KPI 是「研究摘要质量」,GDPVal 更有参考价值,但仍需自家文档样本抽检。任何单列分数写进采购 RFP 时,应附 SpaceXAI 脚注链接并标注 self-reported。Harvey LAB 等垂直领域分项在通稿里 4.6 15.8% 高于 4.5 12.9%,但 Sol Max 仅 2.5% 的对比行同样来自厂商表,法律场景读者应自行做法务样本盲测,不能 extrapolate 到中文合同审查。写 changelog 给团队时,建议附 Evals 表链接而非只复制整数,方便同事自行核对脚注与 harness 说明。

参考资料