一文看懂“北京智能体新政”:Agentic AI的未来蓝图
文章详细解读了北京市发布的《关于加快智能体引领发展的若干措施》,涵盖提升基础模型能力、Harness Engineering、原生应用、智能终端融合、OPC新模式及Token经济等10条重磅内容,描绘了未来智能体经济的宏伟蓝图。
文章详细解读了北京市发布的《关于加快智能体引领发展的若干措施》,涵盖提升基础模型能力、Harness Engineering、原生应用、智能终端融合、OPC新模式及Token经济等10条重磅内容,描绘了未来智能体经济的宏伟蓝图。
本文介绍了 AI Agent 自我优化的新趋势:通过优化 Harness 层(即 Skills)而非模型本身来提升性能。作者详细介绍了名为 evo 的开源优化工具,它利用并行探索、树搜索和门控机制,自动对 Skills 进行实验和迭代。文章展示了在 SealQA 基准测试中,evo 将准确率从 5/20 提升至 11/20 的实战案例,强调了“模型能力 x 优秀的 Harness x 紧密的验证循环”这一杠杆公式的重要性。
文章探讨了从 Prompt Engineering 到 Harness Engineering 的演变,强调真正的 AI-First 需要将 AI 视为生产力主导者而非辅助工具。通过 Creao 团队的案例,阐述了如何重构组织流程以适应极高开发速度,分析了工程师角色转变、跨团队协作自动化以及 Agent 经济的兴起,指出未来的核心价值在于定义需求和结果审核。
本文提供了2026年成为AI/Agent工程师的详细路线图。作者指出,核心在于掌握Harness Engineering(上下文工程与工具编排),而非追逐各种框架。文章介绍了LangGraph和Claude Agent SDK两大主流技术栈,并推荐了包括工程博客、免费课程及Newsletter在内的优质学习资源。通过17周的集中学习和实战项目,读者可以掌握构建、评估及部署生产级Agent系统的能力。
文章详细解读了 OpenAI Agents SDK 的新架构设计,即 Harness(可信层)与 Compute(计算层)分离模式。该架构将凭证管理与代码执行隔离,不仅解决了长时程 Agent 的安全与稳定性痛点,还实现了状态持久化、跨平台部署及简易审计,被视为企业级 Agent 开发的教科书级设计。
本文深入探讨了“Model-Harness-Fit”(模型与协作框架的适配)这一概念。作者通过对比 Codex、Claude Code 和 GitHub Copilot SDK,指出模型在训练后与特定的工具界面、内存协议和规划机制深度绑定。仅更换模型而保留通用框架会导致性能显著下降。文章强调,模型本身的权重不再是唯一的护城河,与其配套的整个工程堆栈才是关键。
文章介绍了一种名为 Agentic Harness Engineering (AHE) 的新框架,该框架能在不改变基础模型和系统提示词的情况下,自动演进编码代理的工具、中间件和内存。AHE 在 Terminal-Bench 2 上通过 32 小时的迭代将性能提升至 77.0%,击败了包括 Codex-CLI 在内的人工调优方法及仅优化提示词的基线。研究还发现,优化内存、工具和中间件比优化系统提示词更能带来显著性能提升。
文章验证了一个关于多 Agent 编排的猜想,通过搭建 hero-coding MVP,对比了 ChatGPT 5.4、Ling-2.6-flash 和 Ling-2.5-1T 在编码任务中的表现。结果显示,非思考小模型(Flash)在明确 Bug 修复上比思考模型快 31%,而 Ling-1T 在加功能任务上仅需 11% 的 Token 和 63% 的时间。作者总结出“大模型规划,小模型干活”的最佳实践,并强调了非思考模型必须配合 Harness 工程兜底的重要性。
文章指出,许多所谓的“AI 智能体”实际上只是连接了工具的模型,演示完美但上线即崩。核心问题往往不在模型本身,而在于支持其运行的“Agent Harness”(智能体挽具/系统)。文章详细解析了 Harness 的三层工程架构(提示工程、上下文工程、系统挽具工程),阐述了编排循环、上下文管理及工具接口的实现机制。作者强调,真正的工程杠杆在于优化这个将无状态模型转化为行动能力的系统,而非盲目更换底层模型。
作者 Junghwan NA 记录了一次极端的“线束工程”(Harness Engineering)实验。他在 72 小时内通过构建一个包含 13 个阶段的自动化流程,利用 OMX 和 Ouroboros 等 AI 代理工具,向包括 Kubernetes、Hugging Face 在内的 100 多个开源仓库提交了 500 多次提交。虽然大部分 PR 质量极高并被维护者直接合并,但这种高频行为触发了 GitHub 的滥用检测机制,导致其账户被封禁。文章深入探讨了实现该流程的技术细节(如本地复现、合并模式匹配),并阐述了在自动化时代,人类判断力和“认证”依然是维持开源系统信任的关键瓶颈。
本文探讨了构建高效 Agent 系统中的关键组件“Resolver”(解析器)。作者指出,与将所有知识塞入系统提示词导致性能下降不同,Resolver 作为一个上下文路由表,能根据任务类型动态加载相关文档。文章通过纠正文件分类错误的实例,展示了如何利用 Resolver 管理技能调用,解决“技能不可见”问题,并通过评估测试确保路由的准确性,从而实现智能体的持续记忆与有效检索。
文章指出,仅仅将 AI 工具(如 Copilot)加入现有流程只是“AI 辅助”,而非真正的“AI 优先”。作者以 CREAO 为例,介绍了“Harness Engineering”理念:通过将代码库统一为单体仓库(Monorepo)以提高 AI 的可读性,利用 Claude 进行自动化代码审查,并建立自愈反馈循环,从而将工程流程从围绕人类编写代码转变为围绕 AI 构建系统,实现极高的迭代速度。
文章探讨了 Harness Engineering 的概念,即通过设计环境、设定标准和建立反馈来构建 AI 的工程环境,从而将 AI 从简单的聊天工具转化为能持续工作的生产力。文章对比了 OpenAI 和 Anthropic 的不同实践路径,并以 VergeX 为例,阐述了 Harness 在 AI 交易中的具体应用,包括工具调用、上下文管理、架构约束和反馈循环四大核心模块。
作者 Leo 结合半年使用 Claude Code 的实战经验,验证了 OpenAI、Cursor 和 Anthropic 提出的 Harness Engineering 三个核心维度:交互维度(通过 CLAUDE.md 传递知识)、空间维度(利用 worktree 隔离防止 Agent 并行冲突)和时间维度(应对长 session 中的上下文退化)。文章总结了个人构建 AI 工作流的落地经验。
文章详细介绍了 Terraform 之父 Mitchell Hashimoto 的 AI 工程实践六个阶段,从早期的聊天窗口尝试,到最终实现后台常驻 Agent 的愿景。核心亮点在于第五阶段提出的“Harness Engineering”(工程约束),即通过系统性设计(如 AGENTS.md 和验证工具)来防止 Agent 重复犯错。文章结合 Anthropic 和 OpenAI 的行业案例,指出工程师的核心技能正从手写代码转向设计 Agent 的运行约束环境。
文章探讨了 AI 智能体的持续学习机制,将其分为三个层次:模型权重的更新、Harness 控制层的优化以及 Context 上下文层的记忆与配置。作者指出,虽然大多数讨论集中在模型层的微调(如 SFT)及其带来的灾难性遗忘问题上,但工程实践中 Harness 代码和 Context 技能(如 SOUL.md)的迭代往往更为灵活高效。文章最后以 LangSmith 和 Deep Agents 为例,强调了 Trace(追踪日志)在驱动所有层级进化中的核心作用。
作者通过分析 Claude Code 源码,生成了一本名为《驾驭工程》的中文技术书。该书涵盖了 AI 编码 Agent 的架构模式、上下文策略、权限体系等生产实践细节,旨在帮助开发者系统理解 Claude Code 的工程实现,并探索 AI 编程的最佳实践。
文章探讨了 Anthropic 提出的 Agent Harness 架构,对比了 Superpowers 和新工具 Compound Engineering (CE)。CE 通过引入 /ce:compound 机制,将工作中的 Debug 经验沉淀为可搜索的项目知识库,实现了 Agent 的自我优化和“记忆”。结合 gstack 的决策层能力,作者认为 gstack + CE 构成了从规划、执行、审查到记忆积累的完整工作流。