📚 Wiki 知识库

技术 / Harness Engineering

70 篇
清除

深度拆解:AI Agent Harness 的构造

文章深入探讨了“AI Agent Harness”的概念,即包裹在大语言模型之外、使其转变为智能体的完整软件架构。作者详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、工具、记忆、上下文管理等),对比了 Anthropic、OpenAI 和 LangChain 的不同实现路径,并指出 Harness 工程是决定 AI 应用性能的关键。

技术Harness Engineering ✍ 宝玉🕐 2026-05-1214.7 KB

Production Deep Agents 运行时指南:弹性执行、内存与多租户

本文探讨了将长运行周期的 Deep Agents 部署到生产环境所需的运行时基础设施。文章指出,除了 Agent 的 Harness(提示词、工具)外,更关键的是底层的 Runtime,它提供了弹性执行、持久化内存、多租户隔离、人在回路(HITL)和可观测性。文章详细介绍了如何通过检查点机制实现故障恢复与状态恢复,区分了短期与长期内存的存储策略,并阐述了在 Agent Server 中实现数据隔离与鉴权的多租户方案。

技术Harness Engineering ✍ LangChain🕐 2026-05-0638.1 KB

Recursive Agent Optimization Actually Works

文章介绍了 HALO(分层 Agent 循环优化),一种构建递归自改进 Agent 框架的方法论。通过专门的递归语言模型(RLM)分析追踪数据并诊断问题,利用编码 Agent 修复漏洞并重新部署。在 AppWorld 基准测试中,经过 5 个循环优化,场景目标完成率从 73.7% 提升至 89.5%。该实验证明,利用 AI 审视自身追踪数据的“鸟瞰视角”能有效识别幻觉模式、工具调用错误及配置缺陷,为未来的框架设计提供了新的优化范式。

技术Harness Engineering ✍ Amar Singh🕐 2026-05-055.7 KB

Model-Harness-Fit: 模型与协作框架的深度适配

本文深入探讨了“Model-Harness-Fit”(模型与协作框架的适配)这一概念。作者通过对比 Codex、Claude Code 和 GitHub Copilot SDK,指出模型在训练后与特定的工具界面、内存协议和规划机制深度绑定。仅更换模型而保留通用框架会导致性能显著下降。文章强调,模型本身的权重不再是唯一的护城河,与其配套的整个工程堆栈才是关键。

技术Harness Engineering ✍ Nicolas Bustamante🕐 2026-05-0453.0 KB

本周顶级 AI 论文综述:Agent 工程、Qwen 模型与世界建模

文章综述了本周五篇重要的 AI 论文。1. Agentic Harness Engineering 提出了可验证的三层演化模型,显著提升了编程 Agent 的 Pass@1 率;2. AgenticQwen-30B 展示了高效的 MoE 模型在工具使用任务上的能力;3. Agentic World Modeling 提出了按定律分级的世界模型分类法;4. RecursiveMAS 通过潜空间递归计算解决了多 Agent 通信的 Token 膨胀问题;5. OneManCompany 探索了动态人才市场的多智能体协作模式。

技术Harness Engineering ✍ DAIR.AI🕐 2026-05-0316.3 KB

如何用 Codex 配置 Hermes 信息评估系统

本文介绍了如何利用 Codex 这一 AI 编码工具,从零开始在 Windows 上部署并配置 Hermes 信息评估系统。Hermes 通过四个智能 Agent 协作,实现对海量信息的自动抓取、价值评估与归档,帮助用户从信息消费者转变为信息评估者,解决注意力匮乏问题。文中详细讲解了环境部署、飞书接入、浏览器会话配置及人工协作的具体步骤。

技术Harness Engineering ✍ zhexin🕐 2026-05-0310.7 KB

Harness Engineering: 为编程代理准备 TypeScript 代码库

本文探讨了在利用 Claude Code 和 Codex 等 AI 编程代理进行“氛围编程”时,如何构建高可维护性的 TypeScript 代码库。文章提出了“Harness Engineering”的概念,强调通过 Monorepo 结构、统一的 ESLint 配置、标准化的 Skill 文件夹结构以及详尽的 CLAUDE.md 文档,为 AI 代理提供明确的“行动线索”和约束机制,从而避免产生难以维护的“AI 垃圾代码”。

技术Harness Engineering ✍ zayne (zeyu) zhang🕐 2026-05-0322.5 KB

为何大家都在构建自己的 Agent Harness

文章指出 AI 领域正发生范式转移:模型不再是产品核心,Agent Harness(控制框架)才是。LangChain 等团队通过优化 Harness,在不改变底层模型的情况下显著提升了性能。随着模型能力的趋同和商品化,竞争壁垒已转移到包含工具调度、上下文管理、沙箱和评估逻辑的工程化框架上。作者建议企业应从单纯的 Agent 开发转向定制化 Harness 的构建,以实现真正的产品化落地。

技术Harness Engineering ✍ Kartik🕐 2026-05-035.5 KB

退休程序员郭宇:把AI当员工,一人公司如何3个月做15个产品

本文记录了前字节跳动员工郭宇在东京的分享。他提出的“Harness Engineering”理念主张将AI视为员工而非工具,通过OneMan系统实现AI自主拆解任务、虚拟团队协作及自动执行。文章详细展示了40分钟生成商业计划的案例,并探讨了AI时代下的信任建立、一人公司的可行性以及对未来科技权力的思考。

技术Harness Engineering ✍ Jason Zhu🕐 2026-05-0210.3 KB

AHE:通过自动演进 Harness 提升智能体编码能力

文章介绍了一种名为 Agentic Harness Engineering (AHE) 的新框架,该框架能在不改变基础模型和系统提示词的情况下,自动演进编码代理的工具、中间件和内存。AHE 在 Terminal-Bench 2 上通过 32 小时的迭代将性能提升至 77.0%,击败了包括 Codex-CLI 在内的人工调优方法及仅优化提示词的基线。研究还发现,优化内存、工具和中间件比优化系统提示词更能带来显著性能提升。

技术Harness Engineering ✍ AlphaSignal AI🕐 2026-05-0115.2 KB

OpenAI开源Symphony:给每一个任务配一个永不下班的AI员工

OpenAI开源了Symphony项目,旨在解决AI Agent规模化管理的瓶颈。该系统将Linear任务看板转化为AI控制中枢,为每个活跃任务分配独立的Agent持续工作,直至交付。文章详细阐述了其架构、工作流及“管理任务而非Agent”的核心理念,标志着软件开发经济学在AI时代的变革。

技术Harness Engineering ✍ 向阳乔木🕐 2026-04-2913.1 KB

The Harness Is the Backend

文章探讨了当前 AI 架构中 Harness(编排层)与后端基础设施分离带来的问题,指出这种分离导致了 Agent 的随机性与后端的确定性之间的调试复杂性。作者提出将后端抽象为 Worker、Trigger 和 Function 三个基本元素,介绍了名为 'iii' 的架构,使 Agent 作为 Worker 直接参与后端系统,而非通过外部集成层调用,从而实现真正的统一基础设施。

技术Harness Engineering ✍ Mike Piccolo🕐 2026-04-2919.0 KB

Compound Engineering v3.3.0 发布:优化 Agent 思维链与交互

Compound Engineering v3.3.0 版本发布,核心更新在于优化 Agent 的交互模式。新版 Agent 会在执行耗时任务前先展示其理解(Stated、Inferred、Out-of-scope),从而在早期纠正错误假设,降低返工成本。此外,文档审查和代码审查技能变得更加智能,减少了不必要的用户打断,能够自动修复更多问题,旨在让 Agent 更易于纠正且更值得信赖。

技术Harness Engineering ✍ Trevin Chow🕐 2026-04-293.5 KB

The Self-Healing Agent Harness

文章介绍了作者开发的“自愈 Agent Harness”系统,该系统通过 AI 代理实现了自动化评估和修复闭环。它包含三个核心组件:用于实时评分的三法官评审团、将低分转化为修复工单的工程管道,以及由 AI 评分控制发布的灰度发布机制。这一系统替代了传统的 QA 和人工审查,使团队能够在每天发布 3-8 次的高频节奏下,自动发现并修复模型幻觉、工具契约漂移或基础设施故障等问题。

技术Harness Engineering ✍ Peter Pang🕐 2026-04-2815.7 KB

傻子可懂的 Harness Engineering 入门教程 + 项目实战

本文深入浅出地讲解了 AI 编程领域热门的 Harness Engineering 概念。文章将其定义为围绕 AI 模型搭建的一整套工作环境与流程,对比了提示词工程、上下文工程的演进关系,并详细拆解了上下文架构、执行能力、任务编排、反馈机制和架构护栏五大核心模块。作者结合“万能视频下载总结器”的全栈项目实战,展示了如何利用 Plan Mode、MCP 工具、Browser Use 及文档沉淀等技巧,让 AI 持续、靠谱地完成复杂工程任务。

技术Harness Engineering ✍ 程序员鱼皮🕐 2026-04-2721.3 KB

AI Agent Harness 解析:为何智能体在生产环境中会崩溃

文章指出,许多所谓的“AI 智能体”实际上只是连接了工具的模型,演示完美但上线即崩。核心问题往往不在模型本身,而在于支持其运行的“Agent Harness”(智能体挽具/系统)。文章详细解析了 Harness 的三层工程架构(提示工程、上下文工程、系统挽具工程),阐述了编排循环、上下文管理及工具接口的实现机制。作者强调,真正的工程杠杆在于优化这个将无状态模型转化为行动能力的系统,而非盲目更换底层模型。

技术Harness Engineering ✍ Suryansh Tiwari🕐 2026-04-278.5 KB

Agent 工程方法实践:Claude Code 与 OpenClaw 的深度对比

文章深入对比了 Claude Code 和 OpenClaw 两个 Agent 框架的工程实现。两者虽都采用 Agent = Model + Harness 的理念,但架构迥异:Claude Code 采用分层堆叠架构,服务于单线程深度编程场景,追求精确可控;OpenClaw 采用管道架构,面向多并发的生活场景,追求自主进化。文章从架构、循环、工具、指令、上下文、记忆等九个维度详细拆解了各自的工程设计权衡。

技术Harness Engineering ✍ Mr Panda🕐 2026-04-2622.7 KB

The Definitive Guide to Harness Engineering

本文介绍了软件工程的新支柱——Harness Engineering(挽具工程),将其定义为一种通过系统化约束和引导,将 AI 模型转化为可靠、可控的“精英表现者”的工程哲学。文章提出了 R.E.S.T 框架来评估生产级 Agent 系统,并阐述了从“执行者”到“架构师”的工程师角色转变,以及如何通过工程化的“硬约束”解决 AI 系统的随机性与可靠性问题。

技术Harness Engineering ✍ TRAE🕐 2026-04-2323.9 KB

AI Coding 已经变天:从 Prompt Engineering 到 Harness Engineering

文章指出 2026 年 AI Coding 的瓶颈已从模型能力转向工程范式。通过 OpenAI、Stripe 等案例,阐述了从 Prompt Engineering、Context Engineering 到 Harness Engineering 的演进。Harness Engineering 强调通过结构化知识、机械化约束、可观测性注入等五大支柱,构建让 AI 可靠工作的环境。作者提出人类角色应从“写代码”转变为设计让 AI 干活的系统。

技术Harness Engineering ✍ 老金🕐 2026-04-2210.3 KB

How I got banned from GitHub due to my harness pipeline

作者 Junghwan NA 记录了一次极端的“线束工程”(Harness Engineering)实验。他在 72 小时内通过构建一个包含 13 个阶段的自动化流程,利用 OMX 和 Ouroboros 等 AI 代理工具,向包括 Kubernetes、Hugging Face 在内的 100 多个开源仓库提交了 500 多次提交。虽然大部分 PR 质量极高并被维护者直接合并,但这种高频行为触发了 GitHub 的滥用检测机制,导致其账户被封禁。文章深入探讨了实现该流程的技术细节(如本地复现、合并模式匹配),并阐述了在自动化时代,人类判断力和“认证”依然是维持开源系统信任的关键瓶颈。

技术Harness Engineering ✍ Junghwan NA🕐 2026-04-219.7 KB

沙盒:Harness 时代的服务器

本文阐述了在 Harness(AI 智能体架构)时代,沙盒作为新型服务器的核心地位。文章从评估测试环境出发,探讨了长期运行的智能体如何依赖沙盒进行隔离执行。重点分析了系统状态的持久化——包括推理轨迹和文件系统数据——对于恢复任务和审计的重要性。作者认为,未来的市场将由拥有“群体”控制层和轨迹数据所有权的一方定义,这引发了关于数据控制权是属于实验室还是企业内部的战略博弈。

技术Harness Engineering ✍ Aparna Dhinakaran🕐 2026-04-206.2 KB

如果裸模很蠢会怎样?Kyle Kingsbury 错在哪里

本文针对 Kyle Kingsbury 关于“LLM 是不可靠的胡扯机器”的观点进行了反驳。作者承认裸模型(Raw Model)不可靠,但指出 Kingsbury 的测试方法类似于在台架上测试发动机并断言汽车不安全。作者提出了“薄线束,胖技能”的架构理念,通过引入确定性代码、技能文件和解算器,将模型的不稳定性转化为可解决的工程问题,从而构建值得信赖的系统。

技术Harness Engineering ✍ Garry Tan🕐 2026-04-1919.0 KB

什么才是真正的 Harness Engineering?

本文基于 OpenAI 工程师 Ryan 的演讲,深入探讨了在 AI 代码生成日益强大的背景下,软件工程范式的转变。核心观点是“代码免费”,实施不再是瓶颈,人类真正的价值在于“指导”和“编排”。文章指出,Harness Engineering 的本质是将人类经验、标准和 taste 转化为上下文和 guardrails,赋予 agent 完整的权限和工具,使其成为自主的执行者,而人类则转型为团队的管理者,专注于定义标准、观察错误和优化流程。

技术Harness Engineering ✍ Saito🕐 2026-04-183.8 KB

如何优化 AI 编程中的 Harness 配置

本文探讨了在 AI 辅助编程中,如何通过优化 Harness(套件)配置来提升代码输出质量。文章提出了三个核心建议:保持配置文件的精简与人工编写,利用 R.P.I. 框架(Research, Plan, Implement)在更高抽象层次上进行交互,以及使用子代理来维护主上下文的清洁。文章强调了工程判断力在 Harness 设置中的重要性。

技术Harness Engineering ✍ Alex Ker🕐 2026-04-1811.7 KB

Harness Engineering: 从执行者到系统架构师

本文提出了“驾驭工程(Harness Engineering)”的概念,指出在 AI Agent 时代,工程师的角色正从代码执行者转变为系统设计者。文章总结了 OpenAI、Anthropic 等公司实战中的 5 个核心思维模式,包括人类掌舵、修系统不修结果、环境外部化、生成与评估分离以及框架做减法。同时,文章给出了 6 条实用启示,强调搭建工作环境的重要性优于单纯选择模型,并指出掌控 AI 记忆是未来的护城河。

技术Harness Engineering ✍ Yanhua🕐 2026-04-158.0 KB

是的,他们确实比你更快

文章指出,随着 AI 的引入,部分公司已将产品交付速度和野心提升到了全新的标准。这些公司利用 AI Agent 在一周内生成数百上千个 PR,通过自上而下的指令、内部工具投资、实际的 Token 预算以及对排名和数据的公开追踪,实现了生产力约 10 倍的增长。无论是初创公司还是拥有数十年历史的遗留企业,都在摒弃情感束缚,全面拥抱 AI。

技术Harness Engineering ✍ claire vo🕐 2026-04-143.3 KB

为什么你的“AI优先”策略可能是错的:从辅助到重塑工程流程

文章指出,仅仅将 AI 工具(如 Copilot)加入现有流程只是“AI 辅助”,而非真正的“AI 优先”。作者以 CREAO 为例,介绍了“Harness Engineering”理念:通过将代码库统一为单体仓库(Monorepo)以提高 AI 的可读性,利用 Claude 进行自动化代码审查,并建立自愈反馈循环,从而将工程流程从围绕人类编写代码转变为围绕 AI 构建系统,实现极高的迭代速度。

技术Harness Engineering ✍ Peter Pang🕐 2026-04-1418.8 KB

为什么你的“AI 优先”战略可能大错特错

文章探讨了“AI First”战略的误区,指出单纯引入 AI 工具并不等于 AI 优先。真正的 AI 优先需要基于“AI 是主力构建者”的假设,彻底重构流程、架构和组织,即“软件工程 First”。文章详细介绍了 CREAO 团队如何利用脚手架工程、统一代码库、CI/CD 流水线和自愈反馈循环,实现 99% 代码由 AI 编写且一天部署多次的高效模式,同时也指出了该模式适用的场景与局限性。

技术Harness Engineering ✍ 宝玉, Peter Pang🕐 2026-04-1427.0 KB