GitHub Copilot HydraFusion 多模型编排 成本降 67% 质量还提升了

GitHub Copilot 发布 HydraFusion 研究预览,运行时动态选择多个 provider 的模型协作完成任务,TerminalBench 2.1 上比 Opus 5 质量高 4.9 点且成本低 67%。

GitHub Copilot HydraFusion 多模型编排 成本降 67% 质量还提升了

2026 年 9 月 4 日,GitHub 发布 Project HydraFusion 研究预览。它不是单一模型,而是一套运行时多模型编排系统:根据任务特征动态选择不同 provider 的模型来起草、审查、修订或升级到更强的模型。在 TerminalBench 2.1 上,HydraFusion 比 Claude Opus 5 质量高 4.9 个百分点,成本却低 67%。

作者CodePass 技术编辑

为什么需要多模型编排

单一最强模型的策略有两个问题:成本高,且不是所有步骤都需要最强模型。写一个简单的单元测试不需要 Opus 5 级别的推理;但设计一个跨模块的重构方案可能需要。

HydraFusion 的思路是把任务拆成多个阶段(起草、审查、修订、升级、重试、回退),每个阶段选择最合适的模型。简单步骤用便宜的模型,关键决策点升级到强模型。

GitHub 在三个 Agent 编程基准上测试了固定策略的 HydraFusion:

基准 成本 vs Opus 5 质量 vs Opus 5
TerminalBench 2.1 67% 更低 +4.9 点
DeepSWE 36% 更低 -1.5 点
CheckpointBench 65% 更低 -0.1 点

TerminalBench 2.1 上质量和成本双赢。DeepSWE 上质量略降 1.5 点但成本降 36%。CheckpointBench(GitHub 自建的、基于真实 Copilot 会话的多轮基准)质量和 Opus 5 几乎持平(差 0.1 点),成本降 65%。

怎么启用

HydraFusion 目前只在 GitHub Copilot CLI 里作为研究预览提供,所有 Copilot 层级(包括免费层)都可以试用:

# 在 Copilot CLI 里
/experimental on
/model  # 选择 HydraFusion

按实际调用的底层模型 token 费率计费,没有额外的 HydraFusion 费用。

和 Cursor Auto 路由的对比

Cursor 的 Auto 模式也是多模型路由,但策略不同。Cursor Auto 根据任务特征选择一个模型来处理整个任务。HydraFusion 在一个任务内部动态切换多个模型,不同阶段用不同模型。

Cognition 的 SWE-2 走的是另一条路:训练一个专门的模型在成本和性能之间找平衡,而不是运行时编排多个模型。三种路径(运行时编排、专用模型、单模型 Auto 路由)都在解决同一个问题:怎么在保持质量的同时降低 Agent 编程的成本。

GitHub 说 HydraFusion 仍是 active research,结果、模型、工作流和可用性会随学习进展而变化。核心观点是:"从选最好的模型,转向动态选最好的解决方式。"

参考资料