GitHub Copilot HydraFusion 多模型编排 成本降 67% 质量还提升了
GitHub Copilot 发布 HydraFusion 研究预览,运行时动态选择多个 provider 的模型协作完成任务,TerminalBench 2.1 上比 Opus 5 质量高 4.9 点且成本低 67%。

2026 年 9 月 4 日,GitHub 发布 Project HydraFusion 研究预览。它不是单一模型,而是一套运行时多模型编排系统:根据任务特征动态选择不同 provider 的模型来起草、审查、修订或升级到更强的模型。在 TerminalBench 2.1 上,HydraFusion 比 Claude Opus 5 质量高 4.9 个百分点,成本却低 67%。
为什么需要多模型编排
单一最强模型的策略有两个问题:成本高,且不是所有步骤都需要最强模型。写一个简单的单元测试不需要 Opus 5 级别的推理;但设计一个跨模块的重构方案可能需要。
HydraFusion 的思路是把任务拆成多个阶段(起草、审查、修订、升级、重试、回退),每个阶段选择最合适的模型。简单步骤用便宜的模型,关键决策点升级到强模型。
GitHub 在三个 Agent 编程基准上测试了固定策略的 HydraFusion:
| 基准 | 成本 vs Opus 5 | 质量 vs Opus 5 |
|---|---|---|
| TerminalBench 2.1 | 67% 更低 | +4.9 点 |
| DeepSWE | 36% 更低 | -1.5 点 |
| CheckpointBench | 65% 更低 | -0.1 点 |
TerminalBench 2.1 上质量和成本双赢。DeepSWE 上质量略降 1.5 点但成本降 36%。CheckpointBench(GitHub 自建的、基于真实 Copilot 会话的多轮基准)质量和 Opus 5 几乎持平(差 0.1 点),成本降 65%。
怎么启用
HydraFusion 目前只在 GitHub Copilot CLI 里作为研究预览提供,所有 Copilot 层级(包括免费层)都可以试用:
# 在 Copilot CLI 里
/experimental on
/model # 选择 HydraFusion
按实际调用的底层模型 token 费率计费,没有额外的 HydraFusion 费用。
和 Cursor Auto 路由的对比
Cursor 的 Auto 模式也是多模型路由,但策略不同。Cursor Auto 根据任务特征选择一个模型来处理整个任务。HydraFusion 在一个任务内部动态切换多个模型,不同阶段用不同模型。
Cognition 的 SWE-2 走的是另一条路:训练一个专门的模型在成本和性能之间找平衡,而不是运行时编排多个模型。三种路径(运行时编排、专用模型、单模型 Auto 路由)都在解决同一个问题:怎么在保持质量的同时降低 Agent 编程的成本。
GitHub 说 HydraFusion 仍是 active research,结果、模型、工作流和可用性会随学习进展而变化。核心观点是:"从选最好的模型,转向动态选最好的解决方式。"