BestBlogs 早报|实现周期骤缩后,创业者如何重选问题
本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。
本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。
本文是 AIGCLINK 与百川智能技术总监郭美青的对谈。双方探讨了 Skill 的本质是模型补丁,指出优质的 Skill 易被大模型内化成训练养料;同时梳理了 Harness、Loop、Graph 等新概念背后的技术演进逻辑。最后建议从业者不要将当下视作终局,应从生意出发,从上往下构建确定性,以应对底层技术的快速迭代。
本文提出解决Agent重复读取数据和Token浪费的三层架构方案:Loop负责单元工作的收集-行动-验证闭环;Graph通过分发和并行管理复杂任务;Harness作为运行时环境提供工具和上下文隔离。文中提供了具体的代码实现思路和实战演示。
文章通过 Databricks 的基准测试发现,精简的 Harness Pi 在任务完成率上与 Claude Code 持平,但上下文消耗仅为其 1/3。作者对比了信息最大化与信息精简两种设计哲学,指出精简的上下文、结构化摘要和信任模型能力的策略,能有效减少注意力分散,提升模型表现。
文章探讨了软件工厂的概念,分为人工介入的“轻工厂”和无人值守的“暗工厂”。作者分析了循环、harness和工厂的关系,指出仅靠harness工程不足以应对代码库质量挑战,并警示暗工厂可能加剧理解债务。
本文探讨了在 AI 时代,工程师角色的根本性转变。通过 OpenAI、Spotify 等案例,指出工程师正从「写代码的人」转变为「编排 Agent 的人」。文章详细阐述了新角色的四个维度:设计约束、编写 Spec、构建 Harness 和审阅产出。团队结构也随之重组,从按技术栈分工转向按 Spec/Review/Harness 流程分工。
本文详细拆解了 Hermes Agent 的底层架构,将其定义为工业级运行时而非简单的 LLM 循环。文章类比前端工程模式,阐述了 Agent = Harness + Model 的核心公式。重点解析了从平台入口、适配器层、事件总线、GatewayRunner 核心调度层到 AI Agent 执行层的五层架构,揭示了 Hermes 如何通过共享线程池、会话复用和生命周期管理,实现高并发、有状态且安全可靠的 Agent 运行环境。
本文记录了前微软、字节工程师王启源的访谈,探讨了从大厂转型独立开发的经历、AI 编程工具(如 Claude Code, Codex)的实战应用、Loop Engineering 与 Harness 的演进,以及未来 Agent OS 的形态。
本文是《人工智能的工程全景》系列的下篇,深入探讨了2025-2026年AI行业的竞争焦点——Agent工程层。文章从Agent定义的演变出发,区分了Workflow与Agent的本质差异,解析了ReAct架构与关键能力清单。重点介绍了Function Calling的工业化起点、MCP协议带来的工具调用标准化,以及Context Engineering与Harness Engineering在Agent系统构建中的核心地位。
文章指出构建 Agent 不能仅依靠大模型,还需要依赖 harness 底座来实现稳定性。作者介绍了 pi-docs-playbook 这一文档整理项目,旨在帮助开发者或 Coding Agent(如 Codex、Claude)高效、准确地阅读和理解 pi 框架文档。通过提供结构化的文档目录、任务阅读矩阵及专用 Prompt,解决了 AI 阅读文档时的幻觉问题,从而快速构建可靠的业务 Agent。
本文深入分析了 NousResearch 的 Hermes 开源 Agent Harness 架构。文章指出 Hermes 全面实现了包括上下文管理、子代理管理、会话持久化等在内的九大核心组件。作者详细探讨了其独特优势:统一的运行时支持多种模型提供商、复杂的三层系统提示词组装、基于 SQLite 的会话即基础设施设计,以及内置的消息网关和 Cron 系统。文章最后展望了其向一级编排能力演进的方向。
本文探讨了构建 AI Agent 系统时的架构问题。作者指出,大多数团队直接采用 LangChain 等现成的框架,这通常会将多种功能耦合在一个单体中,导致后期难以扩展。作者介绍了基于 iii 引擎的解耦方案:将 Harness 拆分为独立的、可替换的微服务,如凭据管理、策略引擎和模型目录。这种架构通过统一的触发原语连接,使开发者能够像搭积木一样自由替换组件,从而实现真正的“自建”系统。
本文针对长任务 Agent 容易出现的“带不住状态、估不准工作量、评不好输出”三大问题,提出工程化的解决方案。文章通过引入状态层、规划层和验证层,构建了一个包含监督机制的五层架构,旨在通过外部控制和证据链,而非单纯的 Prompt 优化,来实现稳定、可落地的 Agent 系统。
本文探讨了Agent项目难以落地的核心原因。作者指出,许多团队忽视了模型与应用之间的基础设施层——Agent Harness。文章通过生理学类比和工程细节分析,阐述了为什么仅靠LLM无法构建高效Agent,并预测AI行业将分化为模型层、Harness平台层和Agent应用层,建议业务团队应专注于业务逻辑而非底层基础设施。
文章深入解析了 pi-goal 这一长程目标自动循环工具的源码机制,并设计了高难度的 Karpathy 开源项目洞察任务,对 Gemini、Claude 和 DeepSeek 三款模型进行了同台实测。结果表明,DeepSeek V4 Pro 在成本上仅是 Gemini 的 1/31,质量却更优。文章还发现过度推理会增加幻觉,以及软预算机制可作为模型行为探针,并指出了 pi-goal 在审计验证上的盲区。
本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。
文章指出 Claude Code 直接使用存在上下文腐烂、缺乏流程约束等工程问题,提出利用 Harness(Agent 系统架构)来规范 AI 行为。作者详细对比了四套方案:Super Powers(纪律层)、GSD(上下文层)、G-Stack(角色层)和 Archon(编排层),并分析了各自的适用场景、优缺点及实施代价,建议开发者根据需求循序渐进地搭建 AI 开发工作流。
文章深入探讨了“AI Agent Harness”的概念,即包裹在大语言模型之外、使其转变为智能体的完整软件架构。作者详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、工具、记忆、上下文管理等),对比了 Anthropic、OpenAI 和 LangChain 的不同实现路径,并指出 Harness 工程是决定 AI 应用性能的关键。
本文基于对 ShareAI 创始人新璐的访谈,深入解读了 Agent Harness 的核心概念与架构设计。文章指出,Harness 是模型之外赋予 AI 行动能力、记忆与协作能力的“身体”。通过剖析 Claude Code 的三层结构——执行层、记忆层与治理层,作者阐述了从“流程驱动”向“模型自主决策”转变的工程实践。文章强调,优秀的 Harness 应提供类 UNIX 的稳定环境与结构化的记忆机制,从而释放模型的潜能,使其成为真正的智能合作伙伴。
文章指出 Agent 可观测性不仅用于调试,更是驱动系统学习的关键。区别于传统软件,Agent 系统必须将链路追踪与反馈信号(如用户显性反馈、隐性行为、LLM 评测或确定性规则)紧密闭环,以在模型、控制架线和上下文层面实现自动或人工驱动的持续改进。
文章指出 AI 领域正发生范式转移:模型不再是产品核心,Agent Harness(控制框架)才是。LangChain 等团队通过优化 Harness,在不改变底层模型的情况下显著提升了性能。随着模型能力的趋同和商品化,竞争壁垒已转移到包含工具调度、上下文管理、沙箱和评估逻辑的工程化框架上。作者建议企业应从单纯的 Agent 开发转向定制化 Harness 的构建,以实现真正的产品化落地。
本文深入剖析了 Agent 系统的工程实现,强调 Harness(测试与约束基础设施)比模型能力更关键。文章详细阐述了 Agent Loop 的稳定性、上下文分层管理以避免 Context Rot、工具设计的 ACI 原则、记忆系统的多维度分类,以及基于失败案例的评测体系。最后通过 OpenClaw 案例,展示了如何利用 Prompt Caching 和按需加载 Skills 来优化系统架构。
文章探讨了当前 AI 架构中 Harness(编排层)与后端基础设施分离带来的问题,指出这种分离导致了 Agent 的随机性与后端的确定性之间的调试复杂性。作者提出将后端抽象为 Worker、Trigger 和 Function 三个基本元素,介绍了名为 'iii' 的架构,使 Agent 作为 Worker 直接参与后端系统,而非通过外部集成层调用,从而实现真正的统一基础设施。
文章深入探讨了多智能体系统背后的数学原理,解释了为何单Agent容易产出平庸方案(陷入“高概率吸引子”的盆地)。作者引用Cognition AI的实验,指出多Agent系统的核心价值不在于协同共享,而在于通过“上下文隔离”制造认知差异,从而打破思维定势。真正的Harness机制是通过改变约束条件,让不同Agent拥有不同的判断标准和认知框架。
文章反驳了 Kyle Kingsbury 关于 LLM 不可靠的结论。作者认为,裸模型仅是“引擎”,其不可预测性需通过“车身”工程(如 Harness、Resolver、确定性工具)来解决。不应测试模型本身,而应测试由模型、路由和工具组成的完整系统。
文章指出工程师的关注点已从 IDE 转向 AI Harness,并介绍了提升 Harness 输出质量的关键方法。核心策略包括:保持配置文件(如 .md)精简,采用渐进式披露原则以节省上下文;利用 R.P.I 框架(Research, Plan, Implement)像资深工程师一样分解问题;以及通过子代理清理主上下文窗口。文章强调,Harness 的核心在于工程判断力。
本文探讨了在 AI 辅助编程中,如何通过优化 Harness(套件)配置来提升代码输出质量。文章提出了三个核心建议:保持配置文件的精简与人工编写,利用 R.P.I. 框架(Research, Plan, Implement)在更高抽象层次上进行交互,以及使用子代理来维护主上下文的清洁。文章强调了工程判断力在 Harness 设置中的重要性。
文章基于 Harness Engineering 三大支柱(评估闭环、架构约束、记忆治理),深度对比了 Nous Research 的 Hermes-Agent 与作者基于 OpenClaw 自建的 MemOS 系统。Hermes 主打“有界热记忆 + CLI 优先”,适合个人快速启动;自建方案则采用“无界记忆 + Hook 机制强制捕获”,实现多 Agent 协作与权限隔离,适合团队长期积累。
本周刊探讨了 AI 开发重心从模型能力转向工程治理的趋势。涵盖腾讯 22 个智能体的工程实践、ThoughtWorks 的约束工程框架、天猫胶水编程 97.9% 采纳率秘诀,以及 Cursor 和 Claude Code 的工具演进。文章指出,行业正从 Vibe Coding 迈向 Agentic Engineering,企业需通过构建 Harness 和规范体系来驾驭日益强大的智能体。
文章分析了 Anthropic 的 Agent Harness 架构,并介绍了 Jason Zuo 如何使用 gstack 和 Compound Engineering (CE) 构建了一套完整的工程工作流。CE 替代了 Superpowers,提供了更深入的规划和审查机制。最关键的差异在于 CE 的 /ce:compound 功能,它通过独立 Agent 将每次开发的经验转化为结构化的项目记忆,实现了 Agent 的自我优化与积累,形成了从规划、执行、审查到记忆的完整闭环。
本文深入分析了泄露的 Claude Code 51 万行源码,指出其核心优势并非 LLM 模型本身,而是围绕模型构建的“Harness”工程体系。文章揭示了“先读后改”、“Fail-closed”、“四态权限管理”等设计原则,阐述了 Anthropic 如何通过上下文压缩、Prompt 编译优化和记忆系统,在承认模型局限性的基础上,通过架构约束实现了极高的准确性与安全性。
本文基于 Anthropic 工程师的实战指南,探讨了如何通过多智能体系统(Multi-Agent System)解决单一 AI 模型在处理长时复杂任务时的上下文退化和自我评估偏差问题。文章通过对比单智能体($9/20分钟)与三智能体系统($200/6小时)在游戏开发中的表现,引入了类似 GAN 的“生成-评估”协作机制。详细介绍了包含规划者、实现者和评估者的全栈开发架构,并提出了系统设计应随任务复杂度和模型能力演化的核心原则。