GitHub 发布 Project HydraFusion 研究预览,用多模型运行时编排降低 Copilot 成本
GitHub 推出 Project HydraFusion 研究预览,通过运行时多模型编排,为每个编码任务自动在 Single、Cascade、Critique 三种执行模式间选择最优工作流,官方基准显示在 TerminalBench 2.1 上成本较 Claude Opus 5 降低 67% 的同时质量反超 4.9 分。所有 Copilot 计划用户现可通过 Copilot CLI 体验。
HydraFusion 是什么:给每个任务自动挑”干活方式”
可以把 HydraFusion 理解为 Copilot 的”调度大脑”:接到任务后,它先制定完整执行计划,再根据推理、代码生成、调试等能力信号,把工作流选择当作优化问题来解,在满足质量门槛的前提下选”最不复杂”的执行方式。开发者使用时和选普通模型一样,只需在模型列表里选中 HydraFusion,背后的模型选择与编排细节完全不用管。新模型上线 Copilot 后也会被评估并纳入它的模型池。
三种执行模式:单模型、级联、交叉评审
Single 模式用一个模型直接完成任务,保住速度;Cascade 模式先由高效模型起草,再经”质量门”判断——合格就收货,不合格自动升级到更强模型;Critique 模式则是一个模型起草后,由另一个不同家族的只读评审者审查,起草模型再修订一次。官方原则是只有额外模型调用可能改善结果时才增加调用,避免为简单任务白白烧 token。
实测数据:成本大降,质量基本持平或反超
对照 Claude Opus 5 基线:TerminalBench 2.1 上成本降低 67%、质量反超 4.9 分;CheckpointBench 上成本降低 65%、质量基本持平;DeepSWE 上成本降低 36%、质量略降 1.5 分。成本核算覆盖起草、评审、修订、升级、重试、回退每一个环节。微软内部工程师评价其推理与任务解决能力”达到或不低于 Opus 水平”。
三步开启试用,建议先跑单提示任务
所有 Copilot 计划用户都能试:在 Copilot CLI 里依次运行 /update 更新版本、/experimental on 打开实验功能、/model 选择 HydraFusion (Research Preview) 即可。计费按实际调用的各模型 token 标准费率计算。预览阶段最适合第一轮、单提示词的编码任务,官方建议从范围明确的大任务入手,交给 Copilot 一次跑完;多轮长会话的强化是下一阶段重点。
原文来源
本文整理自 GitHub Blog:https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration,版权归原作者所有,了解详情请查看原文。

