6种架构模式+60%质量提升:Harness开源项目落地实践 ✍ Jason Zhu🕐 2026-04-01📦 9.9 KB 🟢 已读 𝕏 文章列表 文章介绍了开发者 revfactory 开源的 Claude Code 插件 'Harness',该工具将 Harness Engineering 概念转化为实际可用的协作架构生成器。它内置了 Pipeline、Fan-out/Fan-in 等 6 种协作模式和 5 套团队模板,利用 Progressive Disclosure 技术解决上下文问题。A/B 测试显示,使用该工具在 15 个软件工程任务中实现了 60% 的质量提升和 100% 的胜率,标志着多 Agent 协作从概念讨论迈向了工具化落地。 AgentClaude Code开源架构模式A/B测试自动化代码审查多Agent协作技能构建软件工程 # 6种架构模式+60%质量提升:这个开源项目把 Harness Engineering 从概念变成了工具 **作者**: Jason Zhu **日期**: 2026-03-31T07:17:22.000Z **来源**: [https://x.com/GoSailGlobal/status/2038878300614099180](https://x.com/GoSailGlobal/status/2038878300614099180) ---  上周我们聊了 Anthropic 和 OpenAI 两家大厂对 Harness Engineering 的不同理解,也梳理了九位博主从力挺到质疑的各种立场。概念讨论很热闹,但一个关键问题悬而未决:具体怎么落地?现在有人给出了答案 开发者 revfactory 做了一个叫 Harness 的 Claude Code 插件,直接把 Harness Engineering 的理念变成了可安装、可运行的工具。你告诉它你要做什么,它自动帮你生成一整套 Agent 团队架构,包括 Agent 定义文件、Skill 文件、协作协议、测试用例,全部落到 .claude/agents/ 和 .claude/skills/ 目录里 拆开看看这个项目做了什么 ## 六种架构模式,覆盖了绝大多数协作场景  Harness 内置了六种 Agent 团队协作模式,每种对应一类典型任务 Pipeline(流水线) 适合强依赖的顺序任务。上一个 Agent 的输出直接喂给下一个。比如写小说:世界观设定完了才能设计角色,角色定了才能编剧情。瓶颈很明显,任何一个环节卡住整条线都停 Fan-out/Fan-in(扇出/扇入) 是最自然的多 Agent 模式。多个专家同时并行分析同一个输入,最后汇总结果。做行业研究的时候特别好用,一个 Agent 查官方文档,一个查媒体报道,一个查社区讨论,一个查竞品背景,最后合成一份完整报告 Expert Pool(专家池) 由路由器根据输入类型动态分配给对应专家。代码审查是典型场景,安全问题找安全专家,性能问题找性能专家,不需要所有人同时在线 Producer-Reviewer(生成-评审) 直接呼应了 Anthropic 那篇文章的核心发现。Agent 评估自己的工作几乎没用,必须拆成独立的生成器和评审器。Harness 把这个模式产品化了,内置最多2到3轮重试限制防止死循环 Supervisor(主管) 和 Fan-out 的区别在于动态分配。Fan-out 是一开始就分好任务,Supervisor 是运行时根据实际情况调度。大规模代码迁移就适合这个模式,主管分析文件列表,按复杂度动态分批给不同的迁移 Agent Hierarchical Delegation(层级委派) 处理特别复杂的问题,递归式地把大任务拆成小任务往下派。限制在两层以内,再深就会出现延迟和上下文丢失 六种模式不是随便选的。Harness 在第二阶段(Team Architecture Design)会根据四个维度自动判断:专业化程度、并行潜力、上下文范围、可复用性 ## 五个真实团队配置案例  光有模式定义还不够,Harness 附带了五套完整的团队配置模板 研究团队用 Fan-out/Fan-in 模式,4个专业研究员加1个协调器。官方文档研究员、媒体研究员、社区研究员、背景研究员各自并行工作,发现矛盾信息时通过 SendMessage 交叉验证 科幻小说团队混合了 Pipeline 和 Fan-out,6个 Agent 分4个阶段。第一阶段世界观设计师、角色设计师、剧情架构师三个并行且互相通信。第二阶段文笔师写初稿。第三阶段科学顾问和连续性检查员并行审核。第四阶段文笔师修改终稿。最有意思的是每个阶段的团队用完就销毁,下一阶段重新创建 Webtoon 制作团队用 Producer-Reviewer 模式,只有2个 Agent,画师生成分镜,审核员给三种结果:PASS、FIX、REDO。最多重试2轮就强制通过,防止完美主义死循环 代码审查团队用 Fan-out/Fan-in 加上同行辩论机制。安全审查员、性能审查员、测试审查员三个并行工作,关键点在于审查员之间可以直接 SendMessage 交叉验证。比如安全审查员发现 SQL 注入风险会直接通知性能审查员检查相关查询 代码迁移团队用 Supervisor 模式,1个主管动态调度 N 个迁移执行器。主管按复杂度分批分配文件,执行器认领任务并报告进度,失败的任务自动重新分配 ## A/B 测试数据:60% 质量提升,100% 胜率  这个项目最有说服力的是它附带了一组 A/B 测试数据 15个软件工程任务,分别用有 Harness 和没有 Harness 两种方式完成。结果:平均质量评分从 49.5 提升到 79.3,提升幅度 60%。15个任务里 Harness 方案赢了15个,100% 胜率。输出的方差降低了 32%,意味着结果更稳定可预测 更有意思的是按任务复杂度分层看:基础任务提升 23.8%,进阶任务提升 29.6%,专家级任务提升 36.2%。任务越复杂,Harness 的价值越大。这和 Anthropic 那个实验的结论高度一致,单 Agent 做简单的事还行,复杂任务没有 Harness 基本做不出来 ## Progressive Disclosure:解决 Skill 上下文爆炸  Harness 在 Skill 生成上用了一个叫 Progressive Disclosure(渐进式披露)的设计,解决了一个很实际的问题:Skill 文件写太长会吃掉大量上下文窗口 做法是分三层:元数据层永远加载(名字、描述、触发词),skill.md 主体控制在500行以内,详细的参考资料放到 references/ 目录下按需加载。这样 Agent 平时只消耗很少的 token,需要深入某个领域的时候再加载对应的参考文档 这个思路对所有写 Claude Code Skill 的人都有参考价值。我们自己的发布 Skill 已经超过600行了,或许也该考虑把 troubleshooting 和模板细节拆到 references 里 ## 从概念到工具,三个转变  回头看我们之前梳理的全景图,这个项目把 Harness Engineering 从概念讨论推进到了工具化阶段 第一个转变:从"你需要设计 Harness"到"帮你自动生成 Harness" Anthropic 和 OpenAI 的文章本质上都是在说"Harness 很重要,你应该好好设计"。但怎么设计?用什么模式?Agent 之间怎么通信?这些问题留给了读者自己摸索。Harness 这个项目把选型和生成都自动化了,你描述需求,它输出完整的架构 第二个转变:从单一模式到模式库 之前的讨论里,Anthropic 重点讲了 Producer-Reviewer(生成器+评估器),OpenAI 重点讲了 Pipeline(分层架构)。但实际场景远比这两种丰富。六种模式的体系化覆盖了从简单到复杂的大部分协作需求 第三个转变:从"我觉得好"到"数据说话" 质疑派 Chayenne Zhao 说得对,光靠概念文章很难判断 Harness Engineering 到底有没有用。这个项目用15个任务的 A/B 测试给出了量化证据。60% 的质量提升和 100% 的胜率不是概念,是数字 ## 值得关注的设计细节  几个容易忽略的设计选择 所有 Agent 调用强制指定 model: "opus"。Agent 团队场景下推理质量直接决定协作质量,用弱模型省 token 但协作容易崩 文件系统作为协作基础设施。Agent 之间的中间产物统一存到 _workspace/ 目录,命名规范是 {阶段}_{Agent}_{产物}.{扩展名}。这和 Leo 在社区讨论中提到的观点完全一致:文件系统是最基础的原语,因为只有文件能同时解决持久化、跨 session 协作、多 Agent 共享状态 验证框架不是走形式。每个 Skill 要写8到10个应该触发的查询和8到10个不应该触发的查询,特别强调 near-miss 测试用例。这种严谨度在大多数 Agent 工具里很少见 团队规模有硬限制。2到7个成员,每人3到6个任务。层级委派最多两层。这些约束来自实践中踩过的坑,Agent 太多协调成本指数增长,层级太深上下文丢失严重 ## 局限性和待观察的点  几个限制也要说清楚 Agent Teams 功能需要手动开启环境变量 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1,说明这个能力在 Claude Code 里还是实验性的。稳定性和性能还需要更多实际使用来验证 A/B 测试的15个任务都是软件工程场景,其他领域(写作、研究、设计)的效果还没有数据支撑 六种模式之间的选型建议目前还比较粗粒度,实际场景中很可能需要混合使用。科幻小说那个例子就同时用了 Pipeline 和 Fan-out,但这种混合模式的最佳实践还在摸索中 不过作为第一个把 Harness Engineering 从概念变成可安装工具的项目,方向没问题。至少我们可以停止争论"Harness Engineering 有没有用",开始研究"怎么用得更好"了 via revfactory/harness GitHub / Anthropic Engineering Blog / OpenAI Blog ## 相关链接 - [Jason Zhu](https://x.com/GoSailGlobal) - [@GoSailGlobal](https://x.com/GoSailGlobal) - [11K](https://x.com/GoSailGlobal/status/2038878300614099180/analytics) - [Harness](https://github.com/revfactory/harness) - [Anthropic 那篇文章](https://www.anthropic.com/engineering/harness-design-long-running-apps) - [OpenAI](https://openai.com/index/harness-engineering/) - [revfactory/harness GitHub](https://github.com/revfactory/harness) - [Anthropic Engineering Blog](https://www.anthropic.com/engineering/harness-design-long-running-apps) - [OpenAI Blog](https://openai.com/index/harness-engineering/) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [3:17 PM · Mar 31, 2026](https://x.com/GoSailGlobal/status/2038878300614099180) - [11.4K Views](https://x.com/GoSailGlobal/status/2038878300614099180/analytics) --- *导出时间: 2026/4/1 01:23:34*
关 关于循环工程的思考:验证是核心 本文探讨了“循环工程”(Loop Engineering)的概念,即从编写提示词转向设计运行 Agent 的系统。文章指出,尽管生成器很重要,但循环架构中的核心瓶颈其实是验证器。通过 Bun 移植 Rust 的案例,作者强调了无论内外循环,严格的质量验证和测试才是决定项目成败的关键。 技术 › DevOps ✍ Samuel McDonnell🕐 2026-06-16 Loop EngineeringAgentDevOpsClaude Code验证自动化软件工程工作流
T The 9-Step Loop That Turns Claude Code Into a Senior Engineer 文章指出大多数开发者像使用初级工程师一样使用 Claude Code,缺乏有效的流程。作者提出了一套利用 Claude Code 内置原语(Plan Mode、Subagents、Hooks 等)构建的 9 步闭环流程,旨在模拟资深工程师的工作方式。该流程强调在编写代码前先探索代码库并制定计划,使用 CLAUDE.md 固化标准,利用 Hooks 强制执行不可协商的规则,并通过独立 Agent 进行代码审查,从而实现高质量、自动化的代码交付。 技术 › Claude Code ✍ 0xMorty🕐 2026-06-16 Claude Code工作流自动化代码审查Subagent工程化LLMAgent最佳实践Hooks
A Anthropic 官方插件库全解析:36 个第一方插件,哪些值得你今天就装 Anthropic 发布了 Claude Code 官方插件市场,提供 36 个由官方维护的第一方插件。文章详细解析了这些插件的功能与使用场景,涵盖代码审查、开发工作流、项目配置、插件开发工具及语言智能服务等,并针对不同使用需求推荐了安装搭配方案。 技术 › Claude Code ✍ 雪糕🕐 2026-05-27 Claude CodeAnthropic插件代码审查Agent开发工具LSP安全审查自动化编程效率
S Superpowers:Claude Code 效率暴涨 10 倍的秘密 文章介绍了 Claude Code 的开源技能库 Superpowers,它如同 AI 的导航系统,通过头脑风暴、计划拆解、子代理驱动开发和测试驱动四大核心工作流,自动引导用户从构思到上线。该系统有效降低了认知负荷,并通过严格的审查机制确保代码质量,是提升企业 AI 交付效率的利器。 技术 › Skill ✍ Miles.🕐 2026-05-22 Claude CodeSuperpowers工作流Agent测试驱动自动化开源效率工具开发实践LLM
C Claude Code 实战精选:6 大必备技能与插件推荐 作者基于 400 小时的实际使用经验,总结了在房地产、HVAC 等多个行业中反复证明有效的 6 个 Claude Code 技能。这些工具虽然简单枯燥,但能显著解决实际业务中的效率问题。重点介绍了 Skill Creator(快速生成技能)、Superpowers(强制规范开发流程)、GSD(防止上下文污染)、/review(代码审查)以及 Context Mode(上下文压缩)等工具,它们共同构建了一个从构建到交付的高质量自动化开发工作流。 技术 › Claude Code ✍ Nate Herk🕐 2026-05-03 Claude CodeAgent自动化开发效率SuperpowersGSD代码审查Context Mode
2 2026年我实际使用的30个Claude Code子代理 文章分享了作者在2026年作为Claude Code全操作系统用户时,通过构建和测试100个子代理后筛选出的30个最佳子代理。这些代理拥有独立的系统提示词和工具访问权限,能显著提升工程、DevOps及产品设计等领域的效率,涵盖了代码审查、Bug捕获、数据库迁移验证及规格编写等具体场景。 技术 › Claude Code ✍ Nav Toor🕐 2026-05-01 Claude CodeAgentLLMDevOps编程效率Sub-Agents自动化代码审查工作流技术分享
开 开源「洁癖.Skill」,让你的Agent越用越聪明 文章介绍了一款名为“洁癖.Skill”的开源工具,旨在解决Agent长期使用后因上下文和文档混乱导致的“越用越笨”问题。该Skill通过自动审查和迭代项目的文档、记忆及配置文件(如CLAUDE.md),确保知识库的准确性,适用于Claude Code、Codex等多个平台。作者提出“合并优于追加,删除优于保留”的原则,强调在AI协作中保持信息纯净比信息海量更重要,这能让开发者通过“存档”机制实现Agent的持续进化。 技术 › Skill ✍ 数字生命卡兹克🕐 2026-04-29 AgentClaude开源工具与效率文档管理Claude Code洁癖.Skill提示工程上下文管理自动化
1 15分钟构建首个自动调用的 AI 工作流:Claude Code + SKILL.md 指南 本文是一份基于官方文档和实战经验的 SKILL.md 指南。文章详细解释了 Skill 与 Command、Agent 的区别,阐明了 Skill 是一种通过 Markdown 文件定义的自动触发机制。教程涵盖了 SKILL.md 的结构(Frontmatter 与 Instructions)、如何利用描述字段实现自动调用、路径限定规则以及如何引入辅助文件。此外,作者还推荐了 5 种适合新手构建的 Skill 类型(如 Review、Debug、Test-first),并总结了避免浪费时间的常见错误。 技术 › Skill ✍ Nyk🕐 2026-04-26 Claude CodeSKILL.mdLLMAgent自动化工作流教程MarkdownAI开发代码审查
C Claude Code 仓库里藏了 12 个官方插件 文章介绍了 Claude Code GitHub 仓库中隐藏的 12 个官方插件。重点推荐了 code-review(并行代码审查)、hookify(一键生成 Hook 规则)、ralph-wiggum(循环迭代直到完成)等实用工具,并分类介绍了开发流程类、安全与风格类插件的功能与使用方法。 技术 › Claude Code ✍ sitin🕐 2026-04-17 Claude Code插件代码审查Agent开发工具自动化Hook编程效率Anthropic插件开发
达 达尔文.skill发布:基于棘轮机制的无限进化系统 作者发布了达尔文.skill,这是一套基于Karpathy autoresearch思路的AI技能进化系统。它通过“棘轮机制”和“双重评估”自动优化Skill代码,只保留提升质量的修改。文章详细阐述了五大设计原则、8维度评分体系以及“人在回路”的重要性,实现了从1到N的系统性技能迭代。 技术 › Claude Code ✍ 花叔🕐 2026-04-14 Claude CodeSkillAgent自动化进化算法开源
我 我用Obsidian + Claude Code搭了一个健脑房 本文详细介绍了作者如何构建基于Obsidian和Claude Code的个人工作流系统。文章提出了“未经人脑处理的知识不进仓库”和“输入服务于输出”两大原则,通过构建COO、CTO、心理医生等AI Agent角色,配合定时任务和自动化工作流,实现了一个具有问责机制、自动化记录和个人百科功能的数字“健脑房”,旨在提升思考质量与工作效率。 技术 › 工具与效率 ✍ Haoshan Hong🕐 2026-04-06 ObsidianClaude CodeAgent工作流个人知识管理AI自动化生产力提示词开源
6 6000 Stars的飞书CLI到底能干嘛?我用Claude Code接了一遍 文章详细介绍了飞书开源的 CLI 工具,该工具拥有 6000+ Stars 和 19 个预置 Agent Skills。作者阐述了在 AI 时代 CLI 相比 API 的优势,其三层命令架构设计,以及如何通过 Claude Code、Cursor (MCP) 和 OpenClaw 接入 AI。文章还展示了日程查询、自动发消息、会议纪要生成等实战场景,并提供了安装指南和风险提示。 技术 › 工具与效率 ✍ Jason Zhu🕐 2026-04-02 飞书CLIClaude CodeAgent自动化开源WorkflowMCP效率工具Lark