Cognition 发布 SWE-2 接近前沿模型能力但成本降了 64%
Cognition 发布自研编程模型 SWE-2,FrontierCode 1.1 得分 50.0% 仅差 Fable 5.1 不到一个点,但成本低 64%。基于 Kimi K3 做 RL 后训练。

Cognition 在 2026 年 9 月 10 日发布了 SWE-2,它的自研编程模型。核心数据:FrontierCode 1.1 Main 得分 50.0%,仅差 Anthropic Fable 5.1 的 50.9% 不到一个点,但 Cognition 声称运行成本低 64%。SWE-2 在 Devin Desktop、CLI、Web 和 Fusion 上已可使用。
跑分详情
Cognition 公布了完整的基准对比:
| 基准 | SWE-2 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | Grok 4.6 | SWE-1.7 |
|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 50.9% | 47.5% | 53.3% | 48.0% | 42.0% |
| DeepSWE 1.1 | 73.0% | 67.4% | 72.7% | 74.1% | 67.5% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 91.4% | 88.8% | 89.9% | 88.4% | 81.5% |
| Terminal-Bench 4.0 | 27.3% | 55.8% | 37.3% | 57.9% | 20.3% | 7.6% |
几个值得注意的数据点:SWE-2 在 DeepSWE 1.1 上实际超过了 Fable 5.1(73.0% vs 67.4%),但在 Terminal-Bench 4.0 上差距很大(27.3% vs 55.8%)。Terminal-Bench 4.0 测试的是更复杂的终端操作场景,这是 SWE-2 的明显短板。
和上一代 SWE-1.7 相比,提升非常显著。FrontierCode 从 42.0% 到 50.0%(+8 个百分点),DeepSWE 从 37.7% 到 73.0%(几乎翻倍)。
成本效率是核心卖点
Cognition 强调的不只是性能,更是性价比。SWE-2 medium 版本在 FrontierCode 1.1 Main 上的得分和 SWE-1.7 持平或更高,但平均成本低 81%,所需轮次减少 58%。
减少轮次的原因:SWE-2 medium 在中位数 18 步时开始第一次真正的代码编辑,而 SWE-1.7 需要 48 步。SWE-1.7 被用户反馈"过度探索简单任务",SWE-2 在这方面做了针对性优化,更快切入编辑阶段。
这对 Devin 的 480 亿估值故事很重要。Cognition 的年计算消耗据报道可能达到 8 亿美元,自研更高效的模型直接关系到毛利率。如果 SWE-2 能在保持同等能力的前提下把推理成本降到 Fable 5.1 的三分之一,Devin 的单位经济模型就从根本上改善了。
技术路径
SWE-2 基于月之暗面的 Kimi K3(2.8 万亿参数)做后训练。Kimi K3 本身已经经过了大量的 Agent 编程 RL 训练,Cognition 在此基础上用自己的强化学习继续提升了 5-6 个百分点。
这延续了 SWE-1.7 的路径(基于 Kimi K2.7),Cognition 选择和中国模型公司合作获取基础模型,然后用自己的数据和训练方法做专项优化。这个策略让 Cognition 不需要从零训练大模型,把资源集中在 Agent 编程的强化学习上。
对其他工具用户的影响
SWE-2 目前只在 Devin 生态内可用(Desktop、CLI、Web、Fusion),不通过公开 API 提供。如果你不用 Devin,这个模型的直接影响是零。
间接影响在于基准线的移动。当一个 64% 成本的模型能达到接近前沿的性能时,它给整个市场设定了新的价格预期。Anthropic 和 OpenAI 的 API 定价压力会增加,最终受益的是所有通过 API 调用模型的开发者和工具。