GPT-5.2-Codex 今天发布 原生压缩和网络安全能力提升了什么

OpenAI 9 月 10 日发布 GPT-5.2-Codex,在 SWE-Bench Pro 和 Terminal-Bench 2.0 上刷新纪录,原生上下文压缩、网络安全能力增强,目前仅 Codex 内可用。

GPT-5.2-Codex 今天发布 原生压缩和网络安全能力提升了什么

2026 年 9 月 10 日,OpenAI 发布 GPT-5.2-Codex,定位为"迄今最强的 Agent 编程模型"。它在 SWE-Bench Pro 和 Terminal-Bench 2.0 上刷新了最佳成绩,核心改进包括原生上下文压缩(context compaction)、大规模代码重构能力增强、Windows 环境性能提升,以及显著增强的网络安全能力。目前仅面向 ChatGPT 付费用户在 Codex 内可用,API 访问"未来几周"开放。

作者CodePass 技术编辑

和前代的关键差异

GPT-5.2-Codex 建立在 GPT-5.2 的通用能力之上,同时继承了 GPT-5.1-Codex-Max 的 Agent 编程和终端操作能力。OpenAI 列出的改进方向有四个:

原生上下文压缩(context compaction)让模型在长时间会话中保持完整上下文。这对大型仓库里的跨文件重构和迁移任务尤为重要,之前的模型在上下文过长后容易"忘记"前面的内容或重复之前的错误。

大规模代码变更(重构、迁移、feature build)的可靠性提升。OpenAI 的说法是"即使计划变化或尝试失败,也能继续迭代而不丢失进度"。

Windows 环境性能改善。之前的 Codex 模型在 Windows 上的表现明显弱于 macOS/Linux,这个版本做了针对性优化。

网络安全能力显著增强。OpenAI 表示 5.2-Codex 比 5.1-Codex-Max"更具网络安全能力",并预期后续模型会延续这一趋势。

网络安全能力:为什么这次要单独说

OpenAI 罕见地在 Codex 发布里重点讲了安全能力。文章提到一个案例:Stripe 旗下公司的首席安全研究员 Andrew MacPherson 用 GPT-5.1-Codex-Max 配合 Codex CLI 研究了 React 的 CVE-2026-55182(React2Shell)漏洞,模型能协助复现和分析真实漏洞。

5.2-Codex 进一步增强了这方面的能力。OpenAI 同时披露了一个新项目:面向"经过审核的防御性安全团队"提供邀请制的前沿网络安全能力访问权限(trusted access),模型限制更少。

这引出了双重风险:更强的安全能力既能帮助防御者更快发现和修复漏洞,也能被攻击者利用。OpenAI 的应对是分层发布。普通用户拿到的 5.2-Codex 有标准安全限制;安全研究团队通过邀请制拿到限制更少的版本。

可用性和价格

当前可用范围:所有 ChatGPT 付费用户(Plus、Pro、Team、Enterprise)在 Codex 内可以选择 GPT-5.2-Codex。API 访问尚未开放,OpenAI 说"未来几周"上线。

模型支持 low、medium、high、xhigh 四个推理力度(reasoning effort)设置。知识截止日期为 2025 年 8 月 31 日。

对于 Cursor 用户,需要注意:由于 OpenAI 已宣布 11 月 12 日切断对 Cursor 的模型供应,GPT-5.2-Codex 不会出现在 Cursor 的模型列表里。如果你想用这个模型,需要通过 ChatGPT 的 Codex 界面或等 API 开放后使用 BYOK。关于 Cursor 的迁移策略,可以参考Cursor 迁移 OpenAI 模型的实操步骤

对 AI 编程格局的影响

GPT-5.2-Codex 是 OpenAI 在 Codex 产品线上的第三次重大迭代(5-Codex → 5.1-Codex-Max → 5.2-Codex),节奏是每两个月一个大版本。和 Claude Fable 5.1(Anthropic 9 月 1 日发布)形成直接竞争。

从跑分看,5.2-Codex 在 SWE-Bench Pro 和 Terminal-Bench 2.0 上拿到了新的最高分。但跑分和实际使用体验之间有差距:SWE-Bench 测的是单次任务完成率,日常编程更关注多轮交互中的一致性和可控性。API 开放后才能做更接近真实场景的评测。

对于已经在用 Claude Fable 5.1 的开发者,5.2-Codex 的原生压缩能力是值得关注的差异点。Fable 5.1 的优势在于缓存读取成本降低 75%,适合长时间会话;5.2-Codex 的原生压缩则从模型侧解决上下文管理问题。两种路径哪个更有效,需要实际测试。

参考资料