AI Agents 如何遵循资深工程师工作流
Google Chrome 工程总监 Addy Osmani 开源了 agent-skills 仓库,提出 AI Agent 的可靠性源于周围的约束而非模型本身。该框架采用技能、角色和命令的三层架构,包含反合理化表和强制执行钩子,确保 Agent 遵循测试、审查和安全检查等最佳实践。
Google Chrome 工程总监 Addy Osmani 开源了 agent-skills 仓库,提出 AI Agent 的可靠性源于周围的约束而非模型本身。该框架采用技能、角色和命令的三层架构,包含反合理化表和强制执行钩子,确保 Agent 遵循测试、审查和安全检查等最佳实践。
文章深入探讨了“AI Agent Harness”的概念,即包裹在大语言模型之外、使其转变为智能体的完整软件架构。作者详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、工具、记忆、上下文管理等),对比了 Anthropic、OpenAI 和 LangChain 的不同实现路径,并指出 Harness 工程是决定 AI 应用性能的关键。
本文探讨了将长运行周期的 Deep Agents 部署到生产环境所需的运行时基础设施。文章指出,除了 Agent 的 Harness(提示词、工具)外,更关键的是底层的 Runtime,它提供了弹性执行、持久化内存、多租户隔离、人在回路(HITL)和可观测性。文章详细介绍了如何通过检查点机制实现故障恢复与状态恢复,区分了短期与长期内存的存储策略,并阐述了在 Agent Server 中实现数据隔离与鉴权的多租户方案。
文章介绍了 HALO(分层 Agent 循环优化),一种构建递归自改进 Agent 框架的方法论。通过专门的递归语言模型(RLM)分析追踪数据并诊断问题,利用编码 Agent 修复漏洞并重新部署。在 AppWorld 基准测试中,经过 5 个循环优化,场景目标完成率从 73.7% 提升至 89.5%。该实验证明,利用 AI 审视自身追踪数据的“鸟瞰视角”能有效识别幻觉模式、工具调用错误及配置缺陷,为未来的框架设计提供了新的优化范式。
本文深入探讨了“Model-Harness-Fit”(模型与协作框架的适配)这一概念。作者通过对比 Codex、Claude Code 和 GitHub Copilot SDK,指出模型在训练后与特定的工具界面、内存协议和规划机制深度绑定。仅更换模型而保留通用框架会导致性能显著下降。文章强调,模型本身的权重不再是唯一的护城河,与其配套的整个工程堆栈才是关键。
文章综述了本周五篇重要的 AI 论文。1. Agentic Harness Engineering 提出了可验证的三层演化模型,显著提升了编程 Agent 的 Pass@1 率;2. AgenticQwen-30B 展示了高效的 MoE 模型在工具使用任务上的能力;3. Agentic World Modeling 提出了按定律分级的世界模型分类法;4. RecursiveMAS 通过潜空间递归计算解决了多 Agent 通信的 Token 膨胀问题;5. OneManCompany 探索了动态人才市场的多智能体协作模式。
本文介绍了如何利用 Codex 这一 AI 编码工具,从零开始在 Windows 上部署并配置 Hermes 信息评估系统。Hermes 通过四个智能 Agent 协作,实现对海量信息的自动抓取、价值评估与归档,帮助用户从信息消费者转变为信息评估者,解决注意力匮乏问题。文中详细讲解了环境部署、飞书接入、浏览器会话配置及人工协作的具体步骤。
本文探讨了在利用 Claude Code 和 Codex 等 AI 编程代理进行“氛围编程”时,如何构建高可维护性的 TypeScript 代码库。文章提出了“Harness Engineering”的概念,强调通过 Monorepo 结构、统一的 ESLint 配置、标准化的 Skill 文件夹结构以及详尽的 CLAUDE.md 文档,为 AI 代理提供明确的“行动线索”和约束机制,从而避免产生难以维护的“AI 垃圾代码”。
文章指出 AI 领域正发生范式转移:模型不再是产品核心,Agent Harness(控制框架)才是。LangChain 等团队通过优化 Harness,在不改变底层模型的情况下显著提升了性能。随着模型能力的趋同和商品化,竞争壁垒已转移到包含工具调度、上下文管理、沙箱和评估逻辑的工程化框架上。作者建议企业应从单纯的 Agent 开发转向定制化 Harness 的构建,以实现真正的产品化落地。
本文记录了前字节跳动员工郭宇在东京的分享。他提出的“Harness Engineering”理念主张将AI视为员工而非工具,通过OneMan系统实现AI自主拆解任务、虚拟团队协作及自动执行。文章详细展示了40分钟生成商业计划的案例,并探讨了AI时代下的信任建立、一人公司的可行性以及对未来科技权力的思考。
文章介绍了一种名为 Agentic Harness Engineering (AHE) 的新框架,该框架能在不改变基础模型和系统提示词的情况下,自动演进编码代理的工具、中间件和内存。AHE 在 Terminal-Bench 2 上通过 32 小时的迭代将性能提升至 77.0%,击败了包括 Codex-CLI 在内的人工调优方法及仅优化提示词的基线。研究还发现,优化内存、工具和中间件比优化系统提示词更能带来显著性能提升。
OpenAI开源了Symphony项目,旨在解决AI Agent规模化管理的瓶颈。该系统将Linear任务看板转化为AI控制中枢,为每个活跃任务分配独立的Agent持续工作,直至交付。文章详细阐述了其架构、工作流及“管理任务而非Agent”的核心理念,标志着软件开发经济学在AI时代的变革。
文章探讨了当前 AI 架构中 Harness(编排层)与后端基础设施分离带来的问题,指出这种分离导致了 Agent 的随机性与后端的确定性之间的调试复杂性。作者提出将后端抽象为 Worker、Trigger 和 Function 三个基本元素,介绍了名为 'iii' 的架构,使 Agent 作为 Worker 直接参与后端系统,而非通过外部集成层调用,从而实现真正的统一基础设施。
Compound Engineering v3.3.0 版本发布,核心更新在于优化 Agent 的交互模式。新版 Agent 会在执行耗时任务前先展示其理解(Stated、Inferred、Out-of-scope),从而在早期纠正错误假设,降低返工成本。此外,文档审查和代码审查技能变得更加智能,减少了不必要的用户打断,能够自动修复更多问题,旨在让 Agent 更易于纠正且更值得信赖。
文章介绍了作者开发的“自愈 Agent Harness”系统,该系统通过 AI 代理实现了自动化评估和修复闭环。它包含三个核心组件:用于实时评分的三法官评审团、将低分转化为修复工单的工程管道,以及由 AI 评分控制发布的灰度发布机制。这一系统替代了传统的 QA 和人工审查,使团队能够在每天发布 3-8 次的高频节奏下,自动发现并修复模型幻觉、工具契约漂移或基础设施故障等问题。
本文深入浅出地讲解了 AI 编程领域热门的 Harness Engineering 概念。文章将其定义为围绕 AI 模型搭建的一整套工作环境与流程,对比了提示词工程、上下文工程的演进关系,并详细拆解了上下文架构、执行能力、任务编排、反馈机制和架构护栏五大核心模块。作者结合“万能视频下载总结器”的全栈项目实战,展示了如何利用 Plan Mode、MCP 工具、Browser Use 及文档沉淀等技巧,让 AI 持续、靠谱地完成复杂工程任务。
文章指出,许多所谓的“AI 智能体”实际上只是连接了工具的模型,演示完美但上线即崩。核心问题往往不在模型本身,而在于支持其运行的“Agent Harness”(智能体挽具/系统)。文章详细解析了 Harness 的三层工程架构(提示工程、上下文工程、系统挽具工程),阐述了编排循环、上下文管理及工具接口的实现机制。作者强调,真正的工程杠杆在于优化这个将无状态模型转化为行动能力的系统,而非盲目更换底层模型。
文章深入对比了 Claude Code 和 OpenClaw 两个 Agent 框架的工程实现。两者虽都采用 Agent = Model + Harness 的理念,但架构迥异:Claude Code 采用分层堆叠架构,服务于单线程深度编程场景,追求精确可控;OpenClaw 采用管道架构,面向多并发的生活场景,追求自主进化。文章从架构、循环、工具、指令、上下文、记忆等九个维度详细拆解了各自的工程设计权衡。
本文介绍了软件工程的新支柱——Harness Engineering(挽具工程),将其定义为一种通过系统化约束和引导,将 AI 模型转化为可靠、可控的“精英表现者”的工程哲学。文章提出了 R.E.S.T 框架来评估生产级 Agent 系统,并阐述了从“执行者”到“架构师”的工程师角色转变,以及如何通过工程化的“硬约束”解决 AI 系统的随机性与可靠性问题。
文章指出 2026 年 AI Coding 的瓶颈已从模型能力转向工程范式。通过 OpenAI、Stripe 等案例,阐述了从 Prompt Engineering、Context Engineering 到 Harness Engineering 的演进。Harness Engineering 强调通过结构化知识、机械化约束、可观测性注入等五大支柱,构建让 AI 可靠工作的环境。作者提出人类角色应从“写代码”转变为设计让 AI 干活的系统。
作者 Junghwan NA 记录了一次极端的“线束工程”(Harness Engineering)实验。他在 72 小时内通过构建一个包含 13 个阶段的自动化流程,利用 OMX 和 Ouroboros 等 AI 代理工具,向包括 Kubernetes、Hugging Face 在内的 100 多个开源仓库提交了 500 多次提交。虽然大部分 PR 质量极高并被维护者直接合并,但这种高频行为触发了 GitHub 的滥用检测机制,导致其账户被封禁。文章深入探讨了实现该流程的技术细节(如本地复现、合并模式匹配),并阐述了在自动化时代,人类判断力和“认证”依然是维持开源系统信任的关键瓶颈。
本文阐述了在 Harness(AI 智能体架构)时代,沙盒作为新型服务器的核心地位。文章从评估测试环境出发,探讨了长期运行的智能体如何依赖沙盒进行隔离执行。重点分析了系统状态的持久化——包括推理轨迹和文件系统数据——对于恢复任务和审计的重要性。作者认为,未来的市场将由拥有“群体”控制层和轨迹数据所有权的一方定义,这引发了关于数据控制权是属于实验室还是企业内部的战略博弈。
本文针对 Kyle Kingsbury 关于“LLM 是不可靠的胡扯机器”的观点进行了反驳。作者承认裸模型(Raw Model)不可靠,但指出 Kingsbury 的测试方法类似于在台架上测试发动机并断言汽车不安全。作者提出了“薄线束,胖技能”的架构理念,通过引入确定性代码、技能文件和解算器,将模型的不稳定性转化为可解决的工程问题,从而构建值得信赖的系统。
本文基于 OpenAI 工程师 Ryan 的演讲,深入探讨了在 AI 代码生成日益强大的背景下,软件工程范式的转变。核心观点是“代码免费”,实施不再是瓶颈,人类真正的价值在于“指导”和“编排”。文章指出,Harness Engineering 的本质是将人类经验、标准和 taste 转化为上下文和 guardrails,赋予 agent 完整的权限和工具,使其成为自主的执行者,而人类则转型为团队的管理者,专注于定义标准、观察错误和优化流程。
本文探讨了在 AI 辅助编程中,如何通过优化 Harness(套件)配置来提升代码输出质量。文章提出了三个核心建议:保持配置文件的精简与人工编写,利用 R.P.I. 框架(Research, Plan, Implement)在更高抽象层次上进行交互,以及使用子代理来维护主上下文的清洁。文章强调了工程判断力在 Harness 设置中的重要性。
本文深入解析了AI工程领域的三次范式跃迁:从Prompt Engineering到Context Engineering,再到当前的Harness Engineering。文章用生动的游戏比喻和OpenAI的实际案例,阐述了Harness Engineering的本质——通过建立约束系统来驾驭强大的AI Agent。
本文提出了“驾驭工程(Harness Engineering)”的概念,指出在 AI Agent 时代,工程师的角色正从代码执行者转变为系统设计者。文章总结了 OpenAI、Anthropic 等公司实战中的 5 个核心思维模式,包括人类掌舵、修系统不修结果、环境外部化、生成与评估分离以及框架做减法。同时,文章给出了 6 条实用启示,强调搭建工作环境的重要性优于单纯选择模型,并指出掌控 AI 记忆是未来的护城河。
文章指出,随着 AI 的引入,部分公司已将产品交付速度和野心提升到了全新的标准。这些公司利用 AI Agent 在一周内生成数百上千个 PR,通过自上而下的指令、内部工具投资、实际的 Token 预算以及对排名和数据的公开追踪,实现了生产力约 10 倍的增长。无论是初创公司还是拥有数十年历史的遗留企业,都在摒弃情感束缚,全面拥抱 AI。
文章指出,仅仅将 AI 工具(如 Copilot)加入现有流程只是“AI 辅助”,而非真正的“AI 优先”。作者以 CREAO 为例,介绍了“Harness Engineering”理念:通过将代码库统一为单体仓库(Monorepo)以提高 AI 的可读性,利用 Claude 进行自动化代码审查,并建立自愈反馈循环,从而将工程流程从围绕人类编写代码转变为围绕 AI 构建系统,实现极高的迭代速度。
文章探讨了“AI First”战略的误区,指出单纯引入 AI 工具并不等于 AI 优先。真正的 AI 优先需要基于“AI 是主力构建者”的假设,彻底重构流程、架构和组织,即“软件工程 First”。文章详细介绍了 CREAO 团队如何利用脚手架工程、统一代码库、CI/CD 流水线和自愈反馈循环,实现 99% 代码由 AI 编写且一天部署多次的高效模式,同时也指出了该模式适用的场景与局限性。