用 Codex 做 Auto-research 他如何把 Kernel 提速 232 倍

拆解 GPU Mode 竞赛经验:可测反馈环、1500+ 次提交、idea 多样性与 Codex 爬山,而不是单次神提示。

用 Codex 做 Auto-research 他如何把 Kernel 提速 232 倍

2026-08-15 前后,一篇 Auto-research with codex 在 HN 重新走红:作者在 GPU Mode 的 Householder QR 内核赛里拿到约 232× 相对 baseline 加速,183 人中第 12。关键方法是把竞赛收成 agent 可爬山的闭环,单次神提示撑不起这个名次。

作者CodePass 技术编辑

为什么这题适合 auto-research

组委会提供 popcorn CLI:测、打分、提交都能脚本化,且允许高密度提交(作者 14 天超 1500 次)。Agent 最吃「紧反馈」:形状维明细、几何平均耗时、正确性检查器。没有这条环,所谓 research agent 只是聊天。

作者强调:你不必先成 NVIDIA 专家也能拿到可观加速;但把「未知未知」变成「已知未知」后,提示质量会跳一档。他先和 Claude 把 blocked Householder / WY update 架构谈清,再把实现交给 Codex 循环。

Codex-maxxing 的几条实操

文中可迁移的做法包括:

  • 让循环同时探索多条 idea,避免卡在局部最优;单独一条「看起来最好」的轨迹会自我强化错误假设。
  • 实现提示要带约束与检查器口径(返回格式必须过 torch.geqrf 风格校验),而不是只说「再快点」。
  • 把串行依赖(Householder 列间依赖)显式写进上下文,否则模型会瞎并行。
  • 记录 breakthrough:哪次改动同时动了算法结构与 kernel 细节,便于回放。

对日常工程的含义

多数业务代码没有 1500 次免费提交。能借鉴的是:先把评测做成 CLI,再让 Codex / Claude Code 进环;没有 oracle 的「自动研究」只会烧钱。和 vibe 一把梭相反,这里人负责问题形式化与多样性策略,模型负责在环里穷举实现。GPU 内核只是极端例子,单测+基准同样能搭同构流水线。