AI 编码 Agent——也就是能替你写代码的智能助手,如 Claude Code、Codex、Cursor 里内置的那些——现在改代码非常快。但 QoderAI 团队观察到一个普遍问题:助手越快,围绕它的工作流越容易失控。Better Harness 就是一个专门给「AI 写代码的工作流程」做体检的开源平台:它分析 Agent 干活前后的完整过程,找出流程里的薄弱点,产出一份带证据的改进报告。项目在 GitHub 上开源(QoderAI/better-harness),MIT 协议,目前已有 2.2k Star。适合已经用或准备用 AI 编码助手的开发者,也适合想把「AI 写代码」纳入正规流程的团队。

Better Harness 的出发点很简单:只看 Agent 交出的代码改动(diff,即修改前后的差异对比),看不到流程问题。而流程问题恰恰是 AI 编程最常见的翻车点。作者把常见毛病归纳为五类:

  • 目标模糊:Agent 自信地解决了错误的问题,因为它没搞清楚「完成」的定义;
  • 步骤临时:工作发生在一套没人能复现的路径上;
  • 无证据通过:「它说能用」但缺少验证;
  • 绕过检查:为了速度跳过审查与交付检查;
  • 教训丢失:同样的摩擦,下个任务还会再来一次。

工作方式:事前引导 + 事后反馈

Better Harness 的做法是围绕「Agent Work Loop」(Agent 工作循环)做文章。这个思路来自 Martin Fowler 关于 Harness Engineering(缰绳工程)的文章——不直接管 Agent 写出的代码,而是管它写代码的流程。机制分两个方向:

  • 事前引导(feedforward):在 Agent 动手前,用 AGENTS.md(放在项目里的行为规范说明,告诉 Agent 这个项目的规则)、specs(规格文档)、Skills(技能包,一组可复用的能力定义)和验收标准,先告诉它该怎么干;
  • 事后反馈(feedback):用 linter(自动检查代码风格和低级错误的工具)、自动化测试、Hooks(在特定节点自动触发的脚本)和负责评估的 Agent 观察结果,帮它自我纠错。

五个维度给一次任务打分

围绕这套循环,Better Harness 用五个维度评估一次 AI 编码任务,每个维度对应一个要回答的问题:

维度回答的问题主要依据
任务理解Agent 是否清楚目标与「完成」的定义规则、AGENTS.md、规格、验收标准
受控执行工作是否走在可复现的受支持路径上技能包、命令、受控工具、沙箱边界
变更验证是否有证据证明改动真的有效测试、风格检查、钩子、运行日志
可靠交付AI 提速是否绕过了质量检查人工评审、审批、自动发布流水线、恢复路径
学习沉淀下一个任务能否从本次受益循环发现、可复用技能、记忆

打分的原则是没有证据就不给分:观察不到的环节会显式标注为「证据缺失」,而不是编一个分数凑数。这是项目最强调的设计理念——诚实。

用法:装进你的编码助手,跑一条命令

不需要自己搭服务。把 Better Harness 安装到你正在用的编码助手里,支持 Claude Code、Codex、Qoder、Cursor、GitHub Copilot CLI、Qwen Code、Kimi Code 等 10 个宿主(Host Adapter Matrix,各宿主安装方式不同,README 里逐个说明)。然后在项目目录里运行:

/better-harness analyze this project's AI coding workflow and generate an evidence-backed report

它会分析当前项目的 AI 编码工作流,产出自包含的 report.html(网页报告)、report.md(Markdown 报告)和 findings.json(结构化发现清单)。每一条发现都标注了证据来源、预期结果、修复范围与验收方式,一个团队可以一次只改进一个问题。

多次运行之后,历史视图会显示五个维度随时间的升降曲线——比如「变更验证」从上个月的 3 分提到这个月的 7 分——用来确认改进是否真的生效。项目方刻意注明:这只能说明趋势,不是因果证明。

项目现状

Better Harness 处于快速迭代期:v0.4.1 于 2026 年 8 月 4 日发布,0.7.0-alpha1 已准备完成,最新提交在 2026 年 9 月 9 日;仓库累计 487 次提交、32 位贡献者,代码以 JavaScript(61.4%)和 TypeScript(31%)为主,少量 Rust(3.6%)。项目用三层结构开放:工程实践指南(references)、评估模型(models/agent-work-loop.md)、可运行实现(skills 与宿主适配器),即「既有理念文档,也有能直接跑的代码」。

一句话带走:Better Harness 不试图让 AI 写更多代码,而是让「AI 写的代码」可验证、可复现、可积累——把 AI 编程从「快但不敢信」,变成「快且看得住」。