GitHub Copilot harness 是什么:少装插件,先吃透工作台

GitHub 工程师主张「harness 才是生产力主因」。本文翻译其可复用流程:选工具、沙箱 YOLO、原型、Plan、Autopilot、人工品味、Rubber Duck 交叉评审。

GitHub Copilot harness 是什么:少装插件,先吃透工作台

GitHub Blog 2026-07 文 The harness is all you need (mostly) 泼了一盆冷水:每天新 MCP、新 skill、新「神 prompt」,真正拉开差距的是你是否吃透同一套 Agent 工作台(harness)。花活有趣,可复用增益多半来自:原型 → 计划 → 自动执行 → 人审 → 交叉评审。

Harness 指什么

在 Copilot 家族里,CLI、Copilot app、VS Code、JetBrains 等体验正收敛到同一套编排:提示、工具调用、子代理、Plan/Autopilot、权限模式。学会一次,多端复用。作者建议新手从 Copilot CLI 入门——界面噪音少,反馈直接。

Harness 不等于「某个模型」,而是:

组件 作用
权限模式 Ask / Agent / YOLO,决定能否改盘
工具层 read、edit、bash、子代理调度
会话容器 chat 边界、Plan 清单、Autopilot 循环
环境 本机 vs Codespace vs devcontainer

这和「工具越多越强」相反:MCP 与自定义 Agent 可以后加;先把默认循环跑顺。和我们谈的 约束 vibe coding 一致——约束在流程,不在咒语。

国内开发者若 Copilot 账号或网络不稳定,同一 harness 结构可映射到 Claude Code / Cursor:沙箱、Plan、新会话评审——产品名不同,节奏相同。

八步简流程(可迁移)

1. 选定一个入口
别跨三个 UI 学三套快捷键;先钉死 CLI 或 Copilot app。团队统一入口,文档和录屏才可复用。个人可先 CLI 两周,再决定是否迁 IDE 插件。

2. YOLO / Allow All 放进沙箱
逐条点 Approve 会训练你不读内容。要吞吐就给自主权,但跑在 Codespaces / devcontainer,别在装生产密钥的本机裸奔。

沙箱最低配置:无 .env 生产值、无 ~/.aws 挂载、网络 egress 受限。YOLO 在沙箱里是加速器;在本机是事故预演。

3. 先原型
例如:「给日期选择器 20 个 mock,放在一个 HTML 里对比」。视觉原型挖出文字需求挖不出的细节。非 UI 任务也可先画 API 方案图(Copilot app 支持 Mermaid)。

原型阶段禁止接数据库:用 JSON fixture。你要的是「长什么样、怎么点」,不是「能部署」。

4. 同会话切 Plan
/plan 让模型把边界问题问出来(能否清空、粘贴格式、部分选中……)。可叠加更凶的提问 skill,但你要逐条拍板,别全盘接受。

Plan 输出应收成 checklist,每项可勾选。模糊项如「支持国际化」在 Plan 阶段就标成 Out of Scope,避免 Autopilot 自作主张。

5. Autopilot 执行计划
内置循环逼模型做完清单项;编排会自动挑 Explore(小模型读代码)与更重的子代理——无需先手写多智能体。

Autopilot 跑时你仍要间歇看 diff:不是盯每一行,而是每个 checklist 完成点。异常长 diff 立刻暂停,回到 Plan。

6. 人审与品味迭代
对比度、动画、文案层级仍是你的活。用对话列缺点,配上设计 skill/CSS 框架约束,比「再变好看一点」有效。

列缺点要具体:「主按钮对比度不足 WCAG AA」优于「不够好看」。模型对后者会随机改配色。

7. Rubber Duck 交叉评审
让另一模型家族审当前实现(如主用 GPT 系时拉 Sonnet)。盲区不同。可与 Autopilot 组环,直到剩余项收益递减。

交叉评审只给:核心路径说明 + 关键文件 diff,不给整仓。评审指令用「找会坏的点,不改代码」——与 Claude Code 最后 30% 怎么收尾 同构。

8. 收工换会话
主题漂了就新开 chat,当会话是「话题容器」,降低脏上下文。

模型选择:中等模型 + 中等推理常够用;同一功能中途不换模型,以便吃缓存——省钱逻辑见 AI Agent 浪费 token 怎么省

映射到 Claude Code / Cursor

Copilot 步骤 Claude Code Cursor
CLI 入门 终端 claude Agent 面板或 CLI
Plan Plan Mode Plan / 长 prompt 分步
Autopilot 允许工具循环 Agent 自动 apply
沙箱 devcontainer + 权限 .cursorignore + 规则
Rubber Duck 新会话换模型 换模型或 Composer vs Chat

不必等 Copilot 才能练 harness;关键是固定顺序,不是固定品牌。

和「狂装 MCP」怎么取舍

优先 延后
Plan / Autopilot / 沙箱权限 第十个搜索 MCP
原型与人审节奏 未验证的「神 skill」
Rubber Duck 交叉看 自建多智能体编排秀
团队统一 harness 文档 每人私有咒语库

MCP 不是坏东西,但要过可用性与安全关:见 MCP 可用性评分。Harness 不顺时加 MCP,只会更快把混乱自动化。

常见失败模式

  • 跳过原型直接 Autopilot:清单偏了,返工整模块
  • Plan 全盘接受:范围膨胀,永远做不完
  • 本机 YOLO + 生产 .env:泄露与误删,与 harness 理念相反
  • 从不换会话:上下文污染,模型开始「同意一切」
  • 交叉评审也用来写代码:两个建造者打架,账单翻倍

常见问题

这套流程绑定 Copilot 吗?

步骤可迁移到 Claude Code / Cursor:沙箱、先计划后执行、新会话评审、交叉模型审查——产品名字不同,结构相同。

YOLO 是不是不负责任?

在无隔离本机上是。在 Codespace + 最小密钥环境里,它是吞吐量开关,不是安全策略本身。国内个人本机开发常见「图方便全开」——至少 Separate 演示目录与生产目录。

Rubber Duck 会不会太贵?

比线上漏缺陷便宜。用于收尾与关键模块;改文案不必每次双模型。交叉评审控制在 1–2 轮,边际收益递减就停。

小团队没人写 harness 文档怎么办?

一页纸足够:入口工具、沙箱规则、Plan 模板、何时新开 chat。比收集 50 个 MCP 有用。

Autopilot 和中途手动改代码冲突吗?

可以手动改,但改完更新 Plan checklist 状态,否则 Autopilot 按旧假设继续改,产生冲突 diff。

给团队的一页 harness 模板

可直接贴进内部 Wiki:

入口:Copilot CLI / Claude Code(二选一,禁止每人不同)
沙箱:devcontainer,无生产 .env
流程:原型(静态) → Plan(人批) → 执行 → 人审 → 新会话评审
换会话:单功能完成或 >15 轮
交叉评审:发版前核心模块,指令「只列风险不改代码」
禁止:本机 YOLO + 含密钥目录

新成员 onboarding 先跑通一遍日期选择器级小任务,再碰 monorepo。比发 20 个 MCP 链接更能统一产出质量。

国内网络与账号注意

Copilot 与 GitHub 连通在国内常需稳定代理;harness 里的「沙箱 Codespace」若 RTT 高,可改用本地 devcontainer + 严格 .dockerignore 排除密钥目录。账号层面 Business/Enterprise 才完整覆盖 Admin 策略;个人 Pro 仍可按八步练,只是缺团队级 Router 与合规开关——流程本身不依赖企业席位数。

每周团队站会可问一句:「本周有没有在本机 YOLO 扫过含 .env 的目录?」比讨论「又装了哪个 MCP」更能降风险。Harness 是习惯,不是一次性配置。

参考资料