不懂 Harness Engineering,你所谓的 AI 转型只是在浪费预算
文章探讨了 Harness Engineering 的概念,即通过设计环境、设定标准和建立反馈来构建 AI 的工程环境,从而将 AI 从简单的聊天工具转化为能持续工作的生产力。文章对比了 OpenAI 和 Anthropic 的不同实践路径,并以 VergeX 为例,阐述了 Harness 在 AI 交易中的具体应用,包括工具调用、上下文管理、架构约束和反馈循环四大核心模块。
文章探讨了 Harness Engineering 的概念,即通过设计环境、设定标准和建立反馈来构建 AI 的工程环境,从而将 AI 从简单的聊天工具转化为能持续工作的生产力。文章对比了 OpenAI 和 Anthropic 的不同实践路径,并以 VergeX 为例,阐述了 Harness 在 AI 交易中的具体应用,包括工具调用、上下文管理、架构约束和反馈循环四大核心模块。
Anthropic 和 OpenAI 几乎同时发布关于 Harness Engineering 的文章,引发 AI 社区热议。本文梳理了从 Prompt Engineering 到 Context Engineering 再到 Harness Engineering 的演变,解析了 Anthropic 的“生成器+评估器”循环架构与 OpenAI 的“百万行代码零手写”分层实践,并结合多位博主的观点,探讨了 Agent 时代工程师角色的转变与未来工程实践的方向。
文章批判了将多个AI Agent拟人化为“产品经理”、“工程师”等角色进行流水线协作的“三省六部”架构。作者指出该模式忽视了LLM无专业壁垒的特性,导致推理过程在传递中衰减。通过对比Anthropic、OpenAI和Google的工程实践,文章提出真正的多Agent架构应依赖显式状态文件、并行搜索而非线性分工,并强调保持推理链连续性比角色扮演更重要。
文章详细介绍了 Terraform 之父 Mitchell Hashimoto 的 AI 工程实践六个阶段,从早期的聊天窗口尝试,到最终实现后台常驻 Agent 的愿景。核心亮点在于第五阶段提出的“Harness Engineering”(工程约束),即通过系统性设计(如 AGENTS.md 和验证工具)来防止 Agent 重复犯错。文章结合 Anthropic 和 OpenAI 的行业案例,指出工程师的核心技能正从手写代码转向设计 Agent 的运行约束环境。
文章提出了“万物皆可 Skill”的理念,指出高阶的 AI 使用方式应从临时性的提示词升级为可复用的 Skill(能力包)。文章详细阐述了 Skill 的本质(任务边界、流程、标准及失败处理)、与 Prompt 及 Workflow 的区别,并介绍了基于 Codex 构建 Skill 的标准结构、设计原则(如渐进披露)以及通过“元编程”视角实现 Skill 递归进化的方法。
这是一份面向小用户的 Codex(OpenAI coding agent)入门指南。文章指出 Codex 不是单纯的聊天机器人,而是能读写文件、运行命令的“工作搭档”。作者通过对比 ChatGPT,明确了 Codex 的适用场景,并介绍了 App、CLI、IDE 插件等多种入口。核心内容包含四段式提示词模板、常用工作流(解释项目、修 Bug、加功能、审代码)、配置文件 AGENTS.md 的编写方法,以及 MCP、Skills 和 Automations 的区别与用法。最后强调了安全使用原则及新手从只读理解到自动化的进阶路线。
OpenAI 发布 Codex 重大更新,推出六个面向职业角色(如数据分析、销售、投行等)的专属插件,捆绑 62 个应用和 110 个自动化技能。同时上线 Sites 功能,可直接生成交互式网页应用,并新增 Annotations 精准编辑功能。Codex 非开发者用户占比已达 20%,正试图从单一编码工具转型为全能办公调度层,直接威胁依靠“界面好用”作为护城河的中间层 SaaS 工具。
文章介绍了 OpenAI 工程师 Jason Liu 分享的 9 条 Codex 高效工作法,包括持久线程、共享记忆、语音输入、实时纠偏、操作电脑浏览器等。这些方法将 Agent 从单纯的聊天工具转变为能记住上下文、主动执行任务并操作真实应用的长期资产。作者指出,这套通用的 Agent 逻辑不仅适用于 Codex,通过 OpenCode、Playwright 等工具,在 DeepSeek 环境下也能完美复现。
本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。