Anthropic 实测 多 Agent 会踩哪些系统性坑
概括 Anthropic 2026-08-13 研究:swarm 找洞、共建游戏、从众崩塌、合谋定价与认知脆弱,给团队部署清单。

Anthropic Frontier Red Team 在 2026-08-13 发表 Patterns and problems in emerging multiagent systems。结论很直:单 agent 怪癖在多 agent 里会放大成系统性失败;机构仍按「人类速度可监督」设计,而 agent-agent 交互量可能很快超过人-人。
协调:会当工具,不会当同事
把别的 agent 当「有固定输入输出的工具」时,协作还行;当成长期对等 peer(自有目标、无清晰层级)时就摔跤。漏洞扫描实验里,45 个 agent 共享论坛、互相 peer-review,Mythos Preview 协调 swarm 在约 2700 万 token 量级找到远多于「各扫一块」的洞,但两者重叠很少、且互为补充。共建文字开放世界游戏时,旧模型 PR 合不进去;新模型用「几乎不共享文件」躲开冲突;只有 Sonnet 5 一类在「高共享 + 高合并率」上更像样。终局游戏仍然难看:品味与产品判断仍缺人。
从众、合谋、认识论
低方差:同模型同脚手架下,agent 容易做出相同坏决策。实验里大量 agent 起同名分支、同标题小说、同时去写 ray tracer;囚徒困境里同步叛变。资源队列实验里,无协调手段时刷出百万级轮询请求。Bertrand 定价里,哪怕去掉私聊,也能通过公告板合谋价。认知上:对谎言侦测在进步,但「隐藏档案」任务(关键信息在个别成员手里)仍远未饱和。团队若把多 agent 当银弹,先假设它们会同质化踩坑。
给工程团队的短清单
- 可并行且结果可独立验证的任务,优先「分治 + 仲裁」,别一上来全互联。
- 有文件冲突的共建,强制角色/所有权,或接受「高所有权低共享」的过渡形态。
- 加异质性:不同模型、不同 prompt、不同工具预算,对抗从众。
- 对外通道默认不信任;关键决策要有人类或独立校验器。
- 安全扫描类 swarm 只谈「发现与披露流程」,利用细节走正规安全渠道。
站内多 agent 产品向介绍(Cowchat、网格 IDE 等)偏工具盘点;本文偏失败模式,可对照着读。