📚 Wiki 知识库

技术 / Harness Engineering

70 篇
清除

Agent工程架构解析:Harness、Loop与Graph的区别

本文深入解析Agent工程中常被混淆的三个架构层级:Harness工程构建模型运行环境与基础能力;Loop工程设计工作反馈循环,通过验证与迭代提升质量;Graph工程则显式定义工作流拓扑,控制节点分支与状态转换。文章强调理清环境、反馈与流的关系对构建生产级Agent至关重要。

技术Harness Engineering ✍ beamnxw🕐 2026-07-2617.0 KB

Less is More: 当精简的 Harness 击败了功能完备的对手

文章通过 Databricks 的基准测试发现,精简的 Harness Pi 在任务完成率上与 Claude Code 持平,但上下文消耗仅为其 1/3。作者对比了信息最大化与信息精简两种设计哲学,指出精简的上下文、结构化摘要和信任模型能力的策略,能有效减少注意力分散,提升模型表现。

技术Harness Engineering ✍ SaladDay🕐 2026-07-228.8 KB

我在 Pi 中重建了整个 Claude Code 设置

本文介绍了什么是“Harness Engineering”(约束工程),即通过配置模型周边的工具、指令和记忆来提升 AI 输出质量。作者详细演示了如何将 Claude Code 的配置迁移至名为 Pi 的工具,重点包括利用文件管理 Prompt、迁移 Skills、自定义系统提示以及实现记忆功能,从而实现模型的无缝切换和完全控制。

技术Harness Engineering ✍ Tom🕐 2026-07-229.3 KB

BestBlogs 早报 · 07-17|Bun 借 AI 重写、Hook 堵越权、Nemotron 登顶检索

本期早报聚焦 AI 工程落地,精讲 Bun 用 64 个智能体 11 天重写 53.5 万行代码、腾讯 DECO 用 Hook 治理 LLM 偷懒越权、NVIDIA Nemotron 登顶检索榜。此外涵盖 Kimi K3、Inkling 模型、全双工语音等速览,强调竞争焦点从模型参数向工程实践迁移。

技术Harness Engineering ✍ ginobefun🕐 2026-07-1723.8 KB

The architect's guide to harness engineering: How to choose or build the one for you.

本文是一篇关于 AI 架构工程(Harness Engineering)的指南,探讨了如何根据角色(非工程师 vs 工程师)选择或定制 AI 马具。文章分析了购买、定制和自建三种策略,并提出了评估有用马具的八大属性,涵盖上下文管理、工具支持、标准遵循等维度,旨在帮助读者做出最佳技术决策。

技术Harness Engineering ✍ Alex Ker🕐 2026-07-1414.6 KB

一夜之间,全世界的 Agent 能力提高了一个档次:Claude Code 源码泄漏引发的工程革命

文章分析了 Claude Code 源码泄漏事件,指出其核心价值在于揭示了 51 万行 Harness Engineering 代码背后的工程设计,而非模型本身。作者详细拆解了六个关键工程决策(如上下文压缩、多 Agent 协调等),并重点梳理了泄漏后 24 小时内涌现的开源生态,包括洁净室重写、教学项目及各类插件工具,最后总结了 Agent 开发应从“调 prompt”转向“工程化”的核心理念。

技术Harness Engineering ✍ 饼干哥哥AGI(2.0)🕐 2026-07-1315.6 KB

Loop Engineering: The Karpathy Method - and the workflow that just made it 5x better

文章介绍了 Andrej Karpathy 推广的“循环工程”概念,即通过 AI 自动化循环(目标设定、规划、执行、验证)替代传统的单次 Prompt 交互。文章阐述了循环的核心要素,分析了适用场景,并以 AutoResearch 为例展示了其在模型训练中的成效。此外,文章还讨论了构建循环的五大组件,并提出了“双层循环”等进阶优化方法。

技术Harness Engineering ✍ codila🕐 2026-07-1212.8 KB

角色重构——工程师从「写代码的人」变成「编排 Agent 的人」

本文探讨了在 AI 时代,工程师角色的根本性转变。通过 OpenAI、Spotify 等案例,指出工程师正从「写代码的人」转变为「编排 Agent 的人」。文章详细阐述了新角色的四个维度:设计约束、编写 Spec、构建 Harness 和审阅产出。团队结构也随之重组,从按技术栈分工转向按 Spec/Review/Harness 流程分工。

技术Harness Engineering ✍ SagaSu🕐 2026-07-0921.5 KB

Own the Outer Loop: 工程师在AI代理时代的职责边界

文章探讨了在代理工程和软件工厂时代,工程师的角色转变。作者指出,随着 AI 承担更多内部执行循环,工程师必须拥有“外部循环”的问责权,负责定义质量、做出最终裁决并保证可解释性。文章区分了内部循环(能力)与外部循环(能动性),强调虽然 AI 生成代码的速度提升了,但验证、治理和人为的判断力成为了稀缺资源。

技术Harness Engineering ✍ Addy Osmani🕐 2026-07-0921.2 KB

未来 AI 的壁垒不只在模型,而在 Harness 层

文章基于 Lilian Weng 的新作,提出未来 AI 的竞争壁垒将不仅是模型本身,更是包裹模型的 Harness 层(运行系统)。文章深入探讨了 Harness Engineering 的关键要素:文件系统作为持久记忆、子代理并行架构、上下文工程(Context Engineering)从拼接转向认知接口设计,以及优化目标从指令提示词向系统级递归改进的演进。对于构建 Coding Agent 和复杂自动化系统的开发者来说,设计运行时和工作流的能力将比单纯的模型参数更为关键。

技术Harness Engineering ✍ Ethan🕐 2026-07-089.5 KB

Claude Code 作者说他不再写 prompt 了

文章介绍了 Claude Code 作者提出的“循环工程”(Loop Engineering)概念,即通过设计自动化的反馈循环,让 AI Agent 自主完成从执行到校验的全过程。核心在于从“写提示词”转变为“设计终止条件和校验机制”,详细拆解了触发器、执行层、校验器、停止规则等六个关键组件,强调了明确终态和范围约束的重要性。

技术Harness Engineering ✍ Musolsol.𝟎𝐱𝐔🕐 2026-07-068.4 KB

让你的Agent从pi上长出来

文章指出构建 Agent 不能仅依靠大模型,还需要依赖 harness 底座来实现稳定性。作者介绍了 pi-docs-playbook 这一文档整理项目,旨在帮助开发者或 Coding Agent(如 Codex、Claude)高效、准确地阅读和理解 pi 框架文档。通过提供结构化的文档目录、任务阅读矩阵及专用 Prompt,解决了 AI 阅读文档时的幻觉问题,从而快速构建可靠的业务 Agent。

技术Harness Engineering ✍ Sunny🕐 2026-06-034.7 KB

如何构建你自己的 Agent Harness

本文探讨了构建 AI Agent 系统时的架构问题。作者指出,大多数团队直接采用 LangChain 等现成的框架,这通常会将多种功能耦合在一个单体中,导致后期难以扩展。作者介绍了基于 iii 引擎的解耦方案:将 Harness 拆分为独立的、可替换的微服务,如凭据管理、策略引擎和模型目录。这种架构通过统一的触发原语连接,使开发者能够像搭积木一样自由替换组件,从而实现真正的“自建”系统。

技术Harness Engineering ✍ Mike Piccolo🕐 2026-05-2921.7 KB

利用 Auto-research 提升 Agent Harness 技能

本文介绍了 AI Agent 自我优化的新趋势:通过优化 Harness 层(即 Skills)而非模型本身来提升性能。作者详细介绍了名为 evo 的开源优化工具,它利用并行探索、树搜索和门控机制,自动对 Skills 进行实验和迭代。文章展示了在 SealQA 基准测试中,evo 将准确率从 5/20 提升至 11/20 的实战案例,强调了“模型能力 x 优秀的 Harness x 紧密的验证循环”这一杠杆公式的重要性。

技术Harness Engineering ✍ Alok Bishoyi🕐 2026-05-287.9 KB

围绕代码智能体构建系统:八种失败模式与八大支柱

文章探讨了在使用 AI 辅助开发时,除了产品本身外,还需要构建一套支持智能体的“挽具”系统。作者将其定义为包含上下文、来源、能力、工作流等八个支柱的持久层,旨在解决 AI 缺乏项目知识、无法追溯原因、无法实际操作等常见问题,从而实现人机高效协作。

技术Harness Engineering ✍ Karl Wirth🕐 2026-05-2723.9 KB

Builder's Guide: How to Ship your First Product using AI in 2026

本文是一份面向开发者的 AI 产品构建实战指南。作者指出,仅将 AI 作为自动补全工具在复杂项目中会失效,真正的变革在于构建一套可复用的 'Harness' 系统。文章详细介绍了如何通过 .agent 目录结构(包含 AGENTS.md、SKILLS 等)将任务规格转化为可执行的软件,涵盖从规划、实现到验证的核心循环,并提供了适用于 SaaS、MCP 服务及 iOS 应用的通用工作流模板。

技术Harness Engineering ✍ Avid🕐 2026-05-2624.1 KB

Harness 时代 AI-First 的组织架构

文章介绍了 Creao 团队提出的 Harness Engineering 概念,指出真正的 AI-First 并非简单将 AI 作为辅助工具,而是将其作为生产力主导者来重构组织架构。文章探讨了 AI 如何改变开发流程、团队协作模式(如消灭对齐成本)、人才需求(从专才到通才)以及未来的 Agent 经济,强调企业需要将信任从“人”转移到“AI”上,并彻底重新设计工作流。

技术Harness Engineering ✍ Saito🕐 2026-05-265.7 KB

Harness 时代 AI-First 的组织架构

文章探讨了从 Prompt Engineering 到 Harness Engineering 的演变,强调真正的 AI-First 需要将 AI 视为生产力主导者而非辅助工具。通过 Creao 团队的案例,阐述了如何重构组织流程以适应极高开发速度,分析了工程师角色转变、跨团队协作自动化以及 Agent 经济的兴起,指出未来的核心价值在于定义需求和结果审核。

技术Harness Engineering ✍ Saito🕐 2026-05-255.6 KB

pi-goal 源码解析与实测:DeepSeek 性能竟比 Gemini 好 30 倍

文章深入解析了 pi-goal 这一长程目标自动循环工具的源码机制,并设计了高难度的 Karpathy 开源项目洞察任务,对 Gemini、Claude 和 DeepSeek 三款模型进行了同台实测。结果表明,DeepSeek V4 Pro 在成本上仅是 Gemini 的 1/31,质量却更优。文章还发现过度推理会增加幻觉,以及软预算机制可作为模型行为探针,并指出了 pi-goal 在审计验证上的盲区。

技术Harness Engineering ✍ WquGuru🕐 2026-05-2315.4 KB

Agent Harness 拆解:AI Agent 的工程化基础设施

本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。

技术Harness Engineering ✍ 土豆本豆🕐 2026-05-2122.2 KB

Forward Deployed Engineering 101: 如何成为 AI 时代的 FDE

本文深入探讨了 AI 公司(如 Anthropic、OpenAI)急需 Forward Deployed Engineer (FDE) 的原因,指出当大模型能力日益趋同时,将 AI 落地于具体业务场景成为核心竞争力。文章详细解析了 FDE 的核心职责——审计、评估和部署,并强调了深入了解客户环境的重要性。最后,作者为咨询顾问、产品经理和软件开发者提供了 30 天转型路径,建议通过构建生产级 Agent、RAG 管道或评估框架来积累实战经验。

技术Harness Engineering ✍ vas🕐 2026-05-2112.9 KB

如何在不修改模型或提示词的情况下提升编程智能体能力

文章介绍了一项关于 Agentic Harness Engineering (AHE) 的研究。该框架通过自动进化工具、中间件和记忆等 Harness 组件,在不修改底层模型或提示词的情况下,显著提升了编程智能体的性能。实验表明,AHE 在 Terminal-Bench 2 上将 pass@1 从 69.7% 提升至 77.0%,并在 SWE-bench-verified 上表现出更高的成本效率。研究还发现,仅依赖提示词优化反而会导致性能下降,而工具和中间件的进化才是性能提升的关键。

技术Harness Engineering ✍ AlphaSignal AI🕐 2026-05-1715.2 KB

别再让你的 Claude Code 裸奔了,4 套 Agent Harness 总有一款适合你

文章指出 Claude Code 直接使用存在上下文腐烂、缺乏流程约束等工程问题,提出利用 Harness(Agent 系统架构)来规范 AI 行为。作者详细对比了四套方案:Super Powers(纪律层)、GSD(上下文层)、G-Stack(角色层)和 Archon(编排层),并分析了各自的适用场景、优缺点及实施代价,建议开发者根据需求循序渐进地搭建 AI 开发工作流。

技术Harness Engineering ✍ Gyro🕐 2026-05-1411.0 KB