Anthropic 研究员辞职 称 AI 公司在赌上全人类的命 同事公开认同

Jacob Coxon 从 Anthropic 辞职,发帖称 OpenAI 和 Anthropic 都在冲向自我改进的超级智能。帖子阅读量过亿,Anthropic 对齐负责人公开承认风险超过 10%。

Anthropic 研究员辞职 称 AI 公司在赌上全人类的命 同事公开认同

2026 年 9 月 9 日,Jacob Coxon 在 X 上发帖宣布从 Anthropic 辞职。他在帖子里写道:"构建 AI 的人真心相信它可能在这个十年结束前杀死我们所有人。这不是营销噱头。"帖子阅读量超过 1.15 亿。更令人意外的是,Anthropic 的对齐科学负责人 Evan Hubinger 公开回复支持他的说法。

作者CodePass 技术编辑

Coxon 说了什么

Coxon 在 OpenAI 和 Anthropic 共工作了三年,做预训练研究。他的核心论点:

"两家公司都不负责任。他们正在直奔自我改进的超级智能,拿我们的命在赌。"

对 OpenAI 的批评:很多人"没有深刻内化文明级的利害关系"。

对 Anthropic 的批评:风险被充分理解了,但"他们被锁在了一场先到先得的竞赛里。他们认为没有其他人会负责任地行事,所以必须由自己来做,尽管有风险。"

他在 WIRED 的采访中透露了更多内部氛围:"共识是接下来一两年是人类的关键时刻。这是我同事们的原话,他们会说'终局'或'关键时刻'。"

为什么这次不一样

AI 安全领域的辞职声明并不新鲜。Google DeepMind 之前也有研究员因安全问题辞职。但 Coxon 的案例有几个特殊之处。

第一,他放弃了股权。据 Axios 报道,Coxon 在 Anthropic 只待了四个月,而股权需要六个月才能开始 vest。他选择在 vest 之前离开,这意味着他放弃了可能很可观的经济利益。他说:"我不再有任何动机去炒高 Anthropic 的估值。"

第二,现任员工公开背书。Anthropic 对齐科学负责人 Evan Hubinger 回复说:"Jacob 说得对。我们真的真心相信 AI 可能杀死所有人。我个人认为这个概率在未来十年内超过 10%。"他还补充说 Anthropic 目前没有解决超级智能对齐问题的方案,也"不能说明确在朝着获得方案的方向前进"。

另一位高级员工 Samuel Marks 也公开确认了类似的安全担忧。

第三,115 万阅读量。之前的安全研究员辞职声明很少达到这个传播规模,说明公众对 AI 安全的关注度正在快速上升。

对开发者意味什么

如果你每天都在用 Claude Code 写代码,一个合理的问题是:这些内部担忧是否意味着工具会突然改变行为?

短期答案是不会。Coxon 没有指控 Anthropic 目前的产品不安全,他的担忧是关于未来的开发方向。他在接受采访时也说"我没有看到 Anthropic 为了超过竞争对手而在安全上妥协"。

中期来看,Anthropic 可能会在安全限制上更加保守。他们刚发布的威胁情报报告已经显示了这个方向:对 Fable 5 等新模型应用更严格的双用途研究限制。作为开发者,这可能表现为在某些边界场景下 Claude 更频繁地拒绝请求。

Coxon 呼吁其他实验室研究员也站出来。如果更多人响应,这可能推动行业级别的"节奏协议"(pacing agreement),限制各家公司冲向超级智能的速度。这对工具的迭代节奏可能有影响。

参考资料