235 题 CUDA 优化提速 38%:Cursor × NVIDIA 多 Agent

Cursor 与 NVIDIA 用多 Agent 做了 235 题 CUDA 优化,几何均值提速约 38%。看 geomean 别只看冠军题;235 是题量不是所有 CUDA 工作负载,换场景数字会变。

Cursor Multi-Agent 相对 Optimized PyTorch 达 1.38x,Naive PyTorch 仅 0.17x;标题称 235 题几何均值提速 38%

Cursor 在做一套能自主构建、维护复杂软件的多 Agent 系统。最近他们把它和 NVIDIA 摆到一起,去优化 CUDA kernel。数字给得很具体:大约 3 周,覆盖 235 道题,几何均值(geomean)提速 38%。

百分比好听。可基线一旦选错,它立刻变成标题党。所以先把那张图读明白。

图上三根柱子分别是谁

封面图标题写着:Cursor 的 multi-agent system 在 235 道题上拿到 38% geomean speedup。柱状对比是:

  • Naive PyTorch:约 0.17x
  • Optimized PyTorch:标成 1x(虚线基准)
  • Cursor Multi-Agent:约 1.38x(相对那条 1x 基准)

所以这 38% 说的是「比已经调过的 PyTorch 再快一截」,不是「比随手写的慢实现快了几十倍」。Naive 那根 0.17x 只是提醒你未优化有多亏,真正的擂台是中间那根 Optimized。

这条结果为什么值得看

CUDA kernel 优化一向吃专家时间:访存、占用、指令级的细节,改错一次就得重测一轮。Cursor 把故事讲在多 Agent 上,系统自己构建、维护,而不是一次聊天吐段 kernel 就算完。这跟他们之前讲的 Verifier 是一路:写完要跑,跑不过再派人修,性能题尤其吃「测得动」。

读这个数,我会留意几件事。geomean 比「最高加速比」老实,因为它不容易被某一道极端题拉飞。235 是题量,不是所有 CUDA 负载,换一套算子、换一代卡,数字就会动。至于 3 周,那是墙钟时间的说法,里面含编排、重试和人工兜底,没人承诺你本地能照同一张日历复现。

和日常用 Cursor 有啥关系

你大概率不会明天就去重写半个算子库。真正能搬走的是做法。先固定基准:没有 Optimized 这条线,1.38x 就无从谈起,本地优化同理,先写出能重复跑的 bench,再让 Agent 动手。验证得进闭环,性能补丁要是不能自动跑分,Agent 很容易给你一个「看着更快」的幻觉实现,这一层的讨论见 Verifier 怎么卡 Worker。贵模型留给真正难搜的结构,反复试参、跑分这种活,用更省的配置就够,成本上的对照见 模型组合成本

别这样转发

  • 写成「Cursor 让任意 PyTorch 快 38%」,基线不对,范围也不对。
  • 忽略 NVIDIA 合作这个语境,说成编辑器一键出奇迹。
  • 拿 Naive 的 0.17x 当参照物,凑出夸张倍数。

更老实的说法是:在这 235 题的设定下,多 Agent 相对调过的 PyTorch 基线,几何均值大概到 1.38x。

怎么自己验收「有没有学到」

挑一个你仓库里真有的热点路径,不必是 CUDA。先写一个能重复跑的计时脚本,锁死输入规模;再人手或用现成工具做出一版「还算认真」的基线,当作 1x;然后让 Agent 小步改,每步只收能重新跑分的 diff。要是连着几次分数不动或者抖得厉害,先查测量噪声,别急着升模型。

能稳定复现「相对自己那条 1x 基线有提升」,比背下 38% 这个数字有用得多。

相关还可读:Agent / Rules 工作流