Armature 16893 次 session 三大 Agent 选工具仅 42% 一致
Armature 2026 年 9 月 3 日发布实验:Claude Code、Codex、Cursor 在 5292 条有效 session 里仅 42% 选同一第三方工具。本文提炼搜索习惯、Stripe/Neon 集中度与对选型文档的启示。

「Agent 会帮我选 Stripe 还是 Adyen?」在 2026 年 9 月之前,多半只能靠猜。Dev-tools 增长公司 Armature 9 月 3 日发布目前公开规模最大的对照之一:16,893 次 sandbox session(Claude Code、OpenAI Codex、Cursor 三 CLI),经质检保留 5,292 条有效 run,覆盖 51 个合成 codebases、18 个 sector、1,163 种 prompt 变体。核心结论:三者选完全同一第三方产品的比例仅 42%。
实验设计为什么可信(以及 caveat)
Armature 不是只让 Agent「推荐」,Agent 必须在 repo 里安装并写集成代码;Gemini 3.7 Flash 扮演产品 owner 多轮对话;独立 judge 记录最终选型。Traces、prompt、diff 公开,见 leaderboards。
Caveats(原文与 Pivot News 均提到):
Armature 业务含「影响 Agent 选型」的 growth 服务,读数时保持批判。
合成 repo(假公司名、假 git history)+ 真 lockfile;不等于你的 legacy monolith。
10,601 条 run 未进首发数据集,结论可能随 second wave 微调。
五条对开发者有用的观察
搜索策略差很大
Codex 94% session 用 web search,常带site:vendor.com;Cursor 约 2/3;Claude Code 仅 ~30% 但搜时浏览页数约为 Codex 3×。弱 prior 领域(如 sandboxes)Claude 搜索率升到 ~80%。自研 vs 买第三方
Claude Code ~19% 选择 in-house 实现;Codex/Cursor ~10%。Performance CI sector 里 ~52% 自研 gate,高于任何 SaaS。头部 SaaS 仍集中
Payments:Stripe ~88%;Databases:Neon ~66%;Cloud:AWS ~62%。五个 sector 有「过半」默认赢家。contested sector 没有默认
AI gateway:Portkey 与 Cloudflare AI Gateway 各 ~21%;Search:Postgres FTS 仅 ~17% 领先。Voice agents:Claude→Twilio,Codex→OpenAI Realtime API,Cursor→Vapi,三不一。仓库语言/栈影响极大
同一 sector、四种语言栈,email provider 选型可完全不同;「Agent 会选 Postmark」不能从语言无关地推广。
对你写 CLAUDE.md / Cursor Rules 意味着什么
若你不写约束,Agent 用 training prior + 搜索习惯 选型,三人三结果,PR 里可能出现团队未批准的 vendor。
可执行写法:
在 rules 里 点名允许的服务(如 payments: Stripe test mode only)。
禁止 Agent 自行 sign up 生产 API Key;secrets 走 vault。
对 contested sector(Auth、AI gateway)给 decision tree,别留 open-ended「你选一个」。
这与 限额变更总表 同属 2026 Q3「Agent 上生产」文档化浪潮;也和 Token 开销 联动,Armature 实验里 Agent 装工具,工具 schema 越大,后续每 turn 越贵。
和 Cursor / Codex / Claude 选型文怎么配合
Armature 测的是 「加能力选 SaaS」,不是「哪个 IDE 更好」。IDE 对比仍看 Cursor 定价 hub、OpenCode 值不值、Agents API。
Voice 栈分歧可接 OpenAI Realtime API 与 Agents API 公测,Codex 偏 OpenAI Realtime 与 Armature 一致。