GitHub HydraFusion 多模型编排省钱还是省质量

GitHub 于 2026 年 9 月 4 日发布 HydraFusion 研究预览,在 Copilot CLI 里自动选模型和执行策略。三个 benchmark 里成本全降,质量只在一个里超过 Opus 5。

GitHub HydraFusion 多模型编排省钱还是省质量

GitHub 在 2026 年 9 月 4 日放出了 Project HydraFusion,一个 Copilot CLI 里的研究预览功能。它本身没有训练新模型,做的是运行时编排:你提交一个编程任务,HydraFusion 决定用哪个模型、走哪种执行模式来完成。

作者CodePass 技术编辑

三种执行模式

HydraFusion 根据任务特征选择执行路径:

Single 模式下,一个模型直接处理整个任务,适合简单、边界清晰的请求。Cascade 模式先用成本低的模型尝试,如果质量不达标再升级到更强的模型,适合难度不确定的任务。Critique 模式让一个模型出初稿,另一个独立模型做审查,如果审查不过就修改重来。

选择哪种模式不由用户决定,HydraFusion 根据任务的推理需求、代码生成复杂度、调试难度和工具调用特征自动判断。GitHub 没有公开具体的路由规则。

跑分数据怎么看

GitHub 用三个 benchmark 对比 HydraFusion 和 Claude Opus 5:

TerminalBench 2.1 上 HydraFusion 质量高 4.9 个百分点,成本低 67%。这是唯一一个质量和成本都赢的测试。DeepSWE 上成本低 36%,但质量掉了 1.5 个百分点。这个测试侧重跨文件导航和端到端修复,属于 Agent 编程的核心难度区间。CheckpointBench 上成本低 65%,质量低 0.1 个百分点,几乎持平。

VentureBeat 的评论直接点破:成本在所有测试里都降了,质量在三个里只赢了一个。GitHub 把 HydraFusion 定位为"前沿质量",但自己的数据只在特定测试里支撑这个说法。

另一个限制:目前 HydraFusion 只支持单轮任务。多轮对话的编排还在开发中。

怎么试用

HydraFusion 作为研究预览对所有 GitHub Copilot 计划的用户开放。在 Copilot CLI 里操作:

/update          # 更新到最新 CLI
/experimental on # 开启实验功能
/model           # 选择 HydraFusion (Research Preview)

费用按底层模型的标准 token 价格计算。HydraFusion 的每个执行步骤(起草、审查、修改、升级、重试)各自产生 token 消耗,最终账单是所有步骤的总和。

和 Cursor 的自动选模型比

Cursor 也有类似的概念:Router/Compass 系统自动为不同任务选择模型。两者的区别在于执行深度。Cursor 的路由是"选一个模型跑到底";HydraFusion 可以在一个任务里串联多个模型,先起草再审查再修改,涉及多次模型调用。

对于 Cursor 用户来说,HydraFusion 只在 Copilot CLI 里可用,不能在 Cursor 里直接使用。如果你同时有 Copilot 和 Cursor 订阅,可以根据任务类型选工具:需要多模型协同审查的任务试试 HydraFusion,日常编辑和 Agent 任务继续用 Cursor。

想了解 Cursor 自己的模型路由机制,可以看那篇详解。

参考资料