Cognition 发布 SWE-2 接近前沿模型能力但成本降了 64%

Cognition 发布自研编程模型 SWE-2,FrontierCode 1.1 得分 50.0% 仅差 Fable 5.1 不到一个点,但成本低 64%。基于 Kimi K3 做 RL 后训练。

Cognition 发布 SWE-2 接近前沿模型能力但成本降了 64%

Cognition 在 2026 年 9 月 10 日发布了 SWE-2,它的自研编程模型。核心数据:FrontierCode 1.1 Main 得分 50.0%,仅差 Anthropic Fable 5.1 的 50.9% 不到一个点,但 Cognition 声称运行成本低 64%。SWE-2 在 Devin Desktop、CLI、Web 和 Fusion 上已可使用。

作者CodePass 技术编辑

跑分详情

Cognition 公布了完整的基准对比:

基准 SWE-2 Fable 5.1 GPT-5.6 Sol GPT-6 Astra Grok 4.6 SWE-1.7
FrontierCode 1.1 Main 50.0% 50.9% 47.5% 53.3% 48.0% 42.0%
DeepSWE 1.1 73.0% 67.4% 72.7% 74.1% 67.5% 37.7%
Terminal-Bench 2.1 92.8% 91.4% 88.8% 89.9% 88.4% 81.5%
Terminal-Bench 4.0 27.3% 55.8% 37.3% 57.9% 20.3% 7.6%

几个值得注意的数据点:SWE-2 在 DeepSWE 1.1 上实际超过了 Fable 5.1(73.0% vs 67.4%),但在 Terminal-Bench 4.0 上差距很大(27.3% vs 55.8%)。Terminal-Bench 4.0 测试的是更复杂的终端操作场景,这是 SWE-2 的明显短板。

和上一代 SWE-1.7 相比,提升非常显著。FrontierCode 从 42.0% 到 50.0%(+8 个百分点),DeepSWE 从 37.7% 到 73.0%(几乎翻倍)。

成本效率是核心卖点

Cognition 强调的不只是性能,更是性价比。SWE-2 medium 版本在 FrontierCode 1.1 Main 上的得分和 SWE-1.7 持平或更高,但平均成本低 81%,所需轮次减少 58%。

减少轮次的原因:SWE-2 medium 在中位数 18 步时开始第一次真正的代码编辑,而 SWE-1.7 需要 48 步。SWE-1.7 被用户反馈"过度探索简单任务",SWE-2 在这方面做了针对性优化,更快切入编辑阶段。

这对 Devin 的 480 亿估值故事很重要。Cognition 的年计算消耗据报道可能达到 8 亿美元,自研更高效的模型直接关系到毛利率。如果 SWE-2 能在保持同等能力的前提下把推理成本降到 Fable 5.1 的三分之一,Devin 的单位经济模型就从根本上改善了。

技术路径

SWE-2 基于月之暗面的 Kimi K3(2.8 万亿参数)做后训练。Kimi K3 本身已经经过了大量的 Agent 编程 RL 训练,Cognition 在此基础上用自己的强化学习继续提升了 5-6 个百分点。

这延续了 SWE-1.7 的路径(基于 Kimi K2.7),Cognition 选择和中国模型公司合作获取基础模型,然后用自己的数据和训练方法做专项优化。这个策略让 Cognition 不需要从零训练大模型,把资源集中在 Agent 编程的强化学习上。

对其他工具用户的影响

SWE-2 目前只在 Devin 生态内可用(Desktop、CLI、Web、Fusion),不通过公开 API 提供。如果你不用 Devin,这个模型的直接影响是零。

间接影响在于基准线的移动。当一个 64% 成本的模型能达到接近前沿的性能时,它给整个市场设定了新的价格预期。Anthropic 和 OpenAI 的 API 定价压力会增加,最终受益的是所有通过 API 调用模型的开发者和工具。

参考资料