Mitchell Hashimoto 与 AI 工程演进:从聊天机器人到 Harness Engineering ✍ Jason Zhu🕐 2026-04-07📦 7.6 KB 🟢 已读 𝕏 文章列表 文章详细介绍了 Terraform 之父 Mitchell Hashimoto 的 AI 工程实践六个阶段,从早期的聊天窗口尝试,到最终实现后台常驻 Agent 的愿景。核心亮点在于第五阶段提出的“Harness Engineering”(工程约束),即通过系统性设计(如 AGENTS.md 和验证工具)来防止 Agent 重复犯错。文章结合 Anthropic 和 OpenAI 的行业案例,指出工程师的核心技能正从手写代码转向设计 Agent 的运行约束环境。 AI工程Mitchell HashimotoAgentHarness Engineering开发流程自动化LLM王树义AnthropicOpenAI # Mitchell Hashimoto把AI工程的每一步都走了一遍,第五步就是所有人都在讨论的Harness Engineering **作者**: Jason Zhu **日期**: 2026-04-07T05:19:50.000Z **来源**: [https://x.com/GoSailGlobal/status/2041385440826245287](https://x.com/GoSailGlobal/status/2041385440826245287) ---  Terraform 之父 Mitchell Hashimoto 写了一篇长文,完整复盘了他从"AI 没什么用"到"永远有一个 Agent 在后台跑"的六个阶段。最关键的转折点在第五阶段,他给这个阶段起的名字正好是最近整个 AI 工程社区都在讨论的概念:Engineer the Harness ## 第一阶段:扔掉聊天窗口  Hashimoto 最早也是从 ChatGPT 和 Gemini 的网页界面开始的。他用 Gemini 还原了一个 macOS 的 SwiftUI 命令面板,效果不错,稍微改改就能用。但他很快发现了聊天模式的根本问题:纠错成本太高,你得反复告诉模型哪里错了,来回几轮之后上下文就乱了 他的结论是:聊天机器人做不了真正的工程任务,你需要的是 Agent。能读文件、能执行命令、能发 HTTP 请求的 Agent ## 第二阶段:重做自己的工作  这个阶段是最反直觉的。Hashimoto 没有在 Agent 不好用的时候放弃,反而逼自己把所有手动完成的 commit 用 Agent 重做一遍。等于同样的工作做两次,手动一次,Agent 一次 这个笨办法让他发现了三个关键原则 把大任务拆成独立的小动作。不要给 Agent 一个模糊的大目标,要拆成一个个可验证的小步骤 把模糊的请求拆成规划和执行两个阶段。先让 Agent 做计划,确认计划合理之后再让它执行 给 Agent 提供自我验证的手段。Agent 写完代码之后应该能自己跑测试,自己截图确认效果,而不是等你来检查 ## 第三阶段:下班前 30 分钟交给 Agent  有了前两个阶段的经验,Hashimoto 开始在每天工作结束前的 30 分钟启动 Agent 任务。这个时间窗口特别适合三类工作 深度调研,比如调研某个库的生态和替代方案。Agent 可以系统性地搜索、阅读文档、整理对比表格 模糊想法的并行探索。你有一个不太确定的方向,让 Agent 先跑一版看看可行性 GitHub issue 分拣。用 gh CLI 让 Agent 自动归类和标记 issue ## 第四阶段:把确定能做好的活外包出去  到这个阶段 Hashimoto 已经知道哪些任务 Agent 能稳定完成了。关键操作是:把任务交出去之后,关掉 Agent 的通知 这个细节很重要。如果你每次 Agent 有输出都去看一眼,上下文切换的成本会把省下的时间全部吃掉。正确的做法是把 Agent 当成一个异步的协作者,你去做别的事,它在后台跑,跑完了你再来看结果 他还提了一个让很多人不舒服的观点:把任务交给 Agent 意味着你自己不会在那个领域积累技能。但他认为这个取舍是值得的,只要你在其他地方保持手动编码的习惯 ## 第五阶段:设计 Harness  这是整篇文章最核心的部分。Hashimoto 对 Harness Engineering 给了一个极简的定义:每次发现 Agent 犯了一个错误,你就花时间设计一个方案,确保它永远不会再犯同样的错误 具体实践有两种形式 第一种是 AGENTS.md 文件。在他的 Ghostty 项目里,AGENTS.md 记录了所有 Agent 已知的失败模式和对应的纠正指令。比如"编译 Zig 的时候不要用 zig build,要用 nix develop",比如"修改这个模块的时候必须同时更新对应的测试" 第二种是编写验证工具。给 Agent 写截图脚本让它能看到自己的 UI 输出,写过滤测试脚本让它能只跑相关的测试用例。这些工具让 Agent 有了自我验证的能力,不需要人来检查每一步 这个定义跟我们之前介绍过的 Anthropic 和 OpenAI 的 Harness Engineering 实践高度一致。Anthropic 的方案是生成器加评估器分离,OpenAI 的方案是用 Linter 和 CI 机械化执行架构约束。三者的共同点是:不靠更好的 Prompt,靠系统性的工程约束 王树义老师在他的文章(Harness Engineering 详解)里给了一个更理论化的框架。他把 Harness 的控制机制分成两类:Guides(前馈控制) 和 Sensors(反馈控制)。Guides 是在 Agent 行动之前给方向,比如代码规范、架构约束。Sensors 是在 Agent 行动之后做观测和纠正,比如测试、监控 Hashimoto 的 AGENTS.md 属于 Guides,他的验证工具属于 Sensors。两者结合就是完整的 Harness 王树义老师还分享了一个特别有代表性的实战案例。他让 Agent 处理 30 张 PPT,串行处理到后面几张的时候质量明显下降,因为设计规范被挤出了上下文窗口。解决方案是给每张 PPT 分配一个独立的 Agent,隔离上下文。这就是 Harness 层面的架构设计,跟 Prompt 写得好不好完全无关 ## 第六阶段:永远有一个 Agent 在跑  Hashimoto 的目标状态是工作日的任何时刻都有至少一个 Agent 在后台运行。他目前做到了 10% 到 20% 的工作时间有 Agent 在跑 一个有趣的偏好:他更喜欢用慢模型跑单个 Agent,而不是用快模型跑多个并行 Agent。他用的是 Amp 的 deep mode,一个任务可能跑 30 分钟以上。他的逻辑是更深的思考比更快的响应更有价值 ## 从个人实践到行业共识  把 Hashimoto 的六个阶段和行业里其他声音放在一起看,一条清晰的演进路径浮现出来 Anthropic 的工程师 Prithvi Rajasekaran 搭了一个多 Agent 系统做前端开发,核心发现跟 Hashimoto 一样:Agent 自己评估自己的工作永远是自我表扬,必须把生成和评估拆开。OpenAI 用 3 个工程师 5 个月写了 100 万行代码,没有一行是人手写的,工程师的全部时间花在设计 Agent 的运行约束上 Karpathy 说他 12 月之后就没手写过一行代码。Every CEO 分享了 90% 用 AI 和 100% 用 AI 之间差了 10 倍的经验。OpenAI 对齐研究员说代码只占你工作价值的 10%,剩下 90% 是写规格说明书 所有这些声音指向同一个结论:工程师的核心技能正在从写代码转向设计 Agent 的运行环境。Hashimoto 的六阶段提供了一条具体的路径,让你知道怎么一步一步走到那里 王树义老师的完整分析见他的 Substack 文章,推荐配合 Hashimoto 的原文一起看,一个讲理论框架,一个讲实操路径 ## 相关链接 - [Jason Zhu](https://x.com/GoSailGlobal) - [@GoSailGlobal](https://x.com/GoSailGlobal) - [1.1K](https://x.com/GoSailGlobal/status/2041385440826245287/analytics) - [Harness Engineering 详解](https://wangshuyi.substack.com/p/harness-engineering) - [Substack 文章](https://wangshuyi.substack.com/p/harness-engineering) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [1:19 PM · Apr 7, 2026](https://x.com/GoSailGlobal/status/2041385440826245287) - [1,109 Views](https://x.com/GoSailGlobal/status/2041385440826245287/analytics) --- *导出时间: 2026/4/7 15:55:41*
不 不懂 Harness Engineering,你所谓的 AI 转型只是在浪费预算 文章探讨了 Harness Engineering 的概念,即通过设计环境、设定标准和建立反馈来构建 AI 的工程环境,从而将 AI 从简单的聊天工具转化为能持续工作的生产力。文章对比了 OpenAI 和 Anthropic 的不同实践路径,并以 VergeX 为例,阐述了 Harness 在 AI 交易中的具体应用,包括工具调用、上下文管理、架构约束和反馈循环四大核心模块。 技术 › Harness Engineering ✍ Lewis爆肝战神🕐 2026-04-13 AIHarness EngineeringAgentOpenAIAnthropicCodexVergeX架构设计上下文管理自动化
深 深入解读 Harness Engineering:AI 工程的第三次范式转移 Anthropic 和 OpenAI 几乎同时发布关于 Harness Engineering 的文章,引发 AI 社区热议。本文梳理了从 Prompt Engineering 到 Context Engineering 再到 Harness Engineering 的演变,解析了 Anthropic 的“生成器+评估器”循环架构与 OpenAI 的“百万行代码零手写”分层实践,并结合多位博主的观点,探讨了 Agent 时代工程师角色的转变与未来工程实践的方向。 技术 › Harness Engineering ✍ Jason Zhu🕐 2026-03-31 AI工程AgentAnthropicOpenAI范式转移ClaudeCodex架构设计自动化开发者工具
2 2026年AI工程师的核心技能:Loop(循环)工程 文章探讨了2026年AI工程范式的转变:从单纯的“提示词工程”转向设计自动化的“循环系统”。OpenAI与Anthropic的专家指出,工程师的角色已变为编写控制Agent的循环。文章深入解析了循环工程的定义、单体Agent与编队模式的区别,以及开放式与封闭式循环的差异。此外,文章重点讨论了循环模式带来的高昂Token成本问题,指出DeepSeek等低成本、大上下文的中国大模型是解决这一经济瓶颈的关键。 技术 › Agent ✍ Rahul🕐 2026-06-10 AI工程AgentDeepSeekLoopOpenAIClaude成本优化工作流自动化编程范式
Z Zero to AI Engineer — The Roadmap Nobody Explains Properly 本文提供了一个为期14周的实战型AI工程师学习路线图,旨在解决初学者“只学不做”的困境。文章从环境搭建开始,详细列出了从AI基础、机器学习、深度学习到现代LLM工程及Agent开发的最佳免费资源(如OpenAI/Anthropic官方课程、Karpathy的教程等)。路线强调通过GitHub项目实践来理解原理,最终掌握部署与评估技能,真正从零开始构建可用的AI系统。 技术 › LLM ✍ Shruti Codes🕐 2026-05-17 AI工程师学习路线LLMAgent深度学习RAG实战教程机器学习OpenAIAnthropic
R Recursive Agent Optimization Actually Works 文章介绍了 HALO(分层 Agent 循环优化),一种构建递归自改进 Agent 框架的方法论。通过专门的递归语言模型(RLM)分析追踪数据并诊断问题,利用编码 Agent 修复漏洞并重新部署。在 AppWorld 基准测试中,经过 5 个循环优化,场景目标完成率从 73.7% 提升至 89.5%。该实验证明,利用 AI 审视自身追踪数据的“鸟瞰视角”能有效识别幻觉模式、工具调用错误及配置缺陷,为未来的框架设计提供了新的优化范式。 技术 › Harness Engineering ✍ Amar Singh🕐 2026-05-05 AgentHalo优化LLM自动化调试RecursiveOpenAI方法论效能
A AHE:通过自动演进 Harness 提升智能体编码能力 文章介绍了一种名为 Agentic Harness Engineering (AHE) 的新框架,该框架能在不改变基础模型和系统提示词的情况下,自动演进编码代理的工具、中间件和内存。AHE 在 Terminal-Bench 2 上通过 32 小时的迭代将性能提升至 77.0%,击败了包括 Codex-CLI 在内的人工调优方法及仅优化提示词的基线。研究还发现,优化内存、工具和中间件比优化系统提示词更能带来显著性能提升。 技术 › Harness Engineering ✍ AlphaSignal AI🕐 2026-05-01 AgentAHEHarness EngineeringCoding Agent自动化LLM系统优化
A AI Agent 从零开发指南:构建你的第一个智能体 本文是一篇从零开始构建 AI Agent 的实战教程。作者整合了 Anthropic 和 OpenAI 等资源,详细介绍了 Agent 的工作原理(核心循环)、五种核心工作流模式(如提示链、路由、并行化等),并提供了从构思、设计工具与记忆机制到落地的完整步骤。文章还探讨了如何利用 LLM 自身辅助设计 Agent,帮助开发者快速构建实用型的自动化智能体。 技术 › Agent ✍ hoeem🕐 2026-04-28 AI AgentLLM开发教程AnthropicOpenAI提示工程工作流自动化LangChainClaude
T Token计算:下一个十年的成本战争 文章指出,随着AI技术的发展,单一的“每百万Token成本”已不再是衡量支出的唯一标准。OpenAI、Anthropic等厂商引入了Session Runtime、Cache、Web Search及Outcome等多元化计费维度。这意味着企业必须从单纯的模型比价,转向针对不同任务的综合成本考量。AI经济的价值正在分层,底层资源作为“公用事业”商品化,而封装了行业Know-how和结果交付的上层服务,则将成为价值沉淀的新高地。 技术 › LLM ✍ 华尔街财经 | WSInsights 【Zenzhe 】🕐 2026-04-28 Token经济成本分析AI商业化OpenAIAnthropic定价模型AgentLLM
告 告别繁琐指令:利用 Codex 记忆与 Chronicle 实现上下文感知编程 作者介绍了 Codex 推出的新功能(如 Chronicle 和 Memories)如何彻底改变了他的工作方式。通过结合自动化知识库和屏幕上下文感知,Codex 能像同事一样理解隐含背景、自主获取信息并执行复杂任务(如同步文档、发 PR、Slack 通知),极大地减少了思维负担和重复解释的成本。 技术 › Codex ✍ Dominik Kundel🕐 2026-04-21 CodexAI工作流AgentChronicle自动化效率提升上下文感知LLM技术实践OpenAI
沙 沙盒:Harness 时代的服务器 本文阐述了在 Harness(AI 智能体架构)时代,沙盒作为新型服务器的核心地位。文章从评估测试环境出发,探讨了长期运行的智能体如何依赖沙盒进行隔离执行。重点分析了系统状态的持久化——包括推理轨迹和文件系统数据——对于恢复任务和审计的重要性。作者认为,未来的市场将由拥有“群体”控制层和轨迹数据所有权的一方定义,这引发了关于数据控制权是属于实验室还是企业内部的战略博弈。 技术 › Harness Engineering ✍ Aparna Dhinakaran🕐 2026-04-20 沙盒AgentLLM架构设计状态持久化推理轨迹开发者工具AnthropicDevOps自动化
C ChatGPT Agent Loop 优化技术解析 本文深入解析了 ChatGPT 如何通过 Harness、API 和 Inference 三层架构优化 Agent 循环,重点介绍了持久化 WebSocket、增量 Token 化、KV 缓存管理和推测解码等技术,以降低成本并提升效率。 技术 › Harness Engineering ✍ Bytebytego🕐 2026-07-30 Agent优化LLM架构ChatGPTOpenAI性能成本控制WebSocketTokenization
B BestBlogs 早报|实现周期骤缩后,创业者如何重选问题 本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。 技术 › Skill ✍ ginobefun🕐 2026-07-30 GPT-5.6Agent创业效率工程ProductHarnessSkillLLMOpenAI