BestBlogs 早报 · 07-29|MCP 无状态化与多智能体编排成本
本期早报探讨 MCP 协议的无状态核心变化与 Claude 的生产化接入,分析 Codex 与 ChatGPT Work 共用的执行框架差异,并审视多智能体并行中上下文搬运的隐性成本“编排器的税”。同时涵盖图工程、vLLM 商业化及 Uber 零增长架构等速览内容。
本期早报探讨 MCP 协议的无状态核心变化与 Claude 的生产化接入,分析 Codex 与 ChatGPT Work 共用的执行框架差异,并审视多智能体并行中上下文搬运的隐性成本“编排器的税”。同时涵盖图工程、vLLM 商业化及 Uber 零增长架构等速览内容。
本文深入解析Agent工程中常被混淆的三个架构层级:Harness工程构建模型运行环境与基础能力;Loop工程设计工作反馈循环,通过验证与迭代提升质量;Graph工程则显式定义工作流拓扑,控制节点分支与状态转换。文章强调理清环境、反馈与流的关系对构建生产级Agent至关重要。
文章指出仅使用 Obsidian 构建笔记库效率低下,AI 读取所有笔记导致成本高昂且速度慢。作者提出了 11 步图谱工程路线图,通过构建路由、索引、节点和边,将“杂乱的文件堆”转化为结构化的知识图谱。这种方法将检索过程从模型调用转变为逻辑匹配,大幅降低 Token 消耗并提升响应速度,实现真正的“第二大脑”。
本课程教授如何构建 AI 智能体图,涵盖图的基本概念、关键模式(如菱形模式)、停止规则及人工审批环节。包含三个实战案例:深度研究台、SEO 内容生成器和市场推广套件,旨在提升业务效率并控制成本。
Anthropic 分享了使用 Claude Code 进行大规模代码迁移的经验,包括将 Bun 从 Zig 迁移到 Rust(两周完成百万行代码)以及 Python 到 TypeScript 的迁移。文章介绍了六步迁移流程,强调建立强大的“评判者”系统、制定规则书和依赖映射,并说明 AI 如何通过并行处理和自动化验证改变了代码迁移的可行性。
文章探讨了构建 Web Agent 基础设施(如浏览器池、隔离机制、观测性等)所面临的复杂性与工程挑战。作者指出,这远不止是启动一个浏览器,需要处理冷启动、安全隔离、资源调度等深层问题,并分析了自建与购买的权衡。
作者分享了阅读 Google Cloud 《多租户智能体 AI 系统》参考架构后的 5 个核心启发。文章指出企业级 Agent 落地需关注中心辐射模式、系统级安全防护(Model Armor)、MCP 的企业级用法以及完整的闭环流程。作者认为单纯依靠 Prompt 的时代即将结束,未来的重点在于系统架构设计与安全边界。
文章探讨了将本地 Agent Demo 转化为可商业化产品的六大工程挑战:会话记忆持久化、工具调用沙箱隔离、调用链路追踪、模型成本控制、前后端一体化交付以及技术栈与框架的灵活性。作者以腾讯云 EdgeOne Makers 平台为例,演示了如何高效解决这些工程化难题,实现 Agent 应用的快速开发与部署。
作者分享了将文章转化为网页视频的全过程。文章详细探讨了从使用 Voicebox 生成 TTS 音频的尝试,到发现逐段生成音色漂移、整段切分不准等问题,最终采用“整章音频 + cue 时间轴”的解决方案。内容涵盖了 TTS 技术选型、前端播放逻辑以及踩坑后的工具化思考。
作者分享了在“文章转视频”项目中的技术选型思考。虽然 HyperFrames 在视频渲染、时间轴和字幕同步上表现专业,但作者更倾向于自建的 web-video-presentation 方案。文章指出,此类任务的核心难点在于前期内容的生产与验收(如口播脚本、节奏控制),而非后期的渲染。web-video-presentation 通过定义 script.md 和 outline.md,并以“第一章成品验收”为锚点,有效解决了内容生产流程的痛点。最终建议是将两者分层协作:前者负责内容创作,后者负责成片导出。
文章以「好记性不如烂笔头」为喻,深入剖析了 AI 助手 WorkBuddy 的三层记忆架构(云端画像、本地长期记忆、工作区日志)。通过对比传统 AI 的「金鱼式」失忆,阐述了长程任务中「读写外部文件」优于单纯依赖上下文窗口的原理。同时,文章探讨了记忆与身份层如何赋予 AI 连续性,并与 OpenClaw 进行了横向对比。
作者通过一年的 AI Agent 开发实践,发现 90% 的时间浪费在手动测试上。受芯片“验证不对称”理念启发,作者提出构建可验证的架构:通过前后端分离(ACI)使系统对 AI 友好,并引入“确定性断言”和“LLM 裁判”两级回归测试体系。最终实现了由 Coding Agent 自动运行的闭环开发,将开发者从繁琐的手工验证中解放出来,重塑了 AI 时代的开发效率。
本文详细解析了 Codex 与 HyperFrames 结合的 AI 自动剪辑技术。HyperFrames 作为渲染引擎,利用 HTML/CSS/JS 实现确定性视频生成;Codex 作为智能体,负责编排与代码编写。文章涵盖了环境搭建、6步核心工作流、提示词工程、合成契约规范及调试避坑指南,展示了从脚本到 MP4 的全自动化视频生产管线。
文章介绍了 Claude Code 作者提出的“循环工程”(Loop Engineering)概念,即通过设计自动化的反馈循环,让 AI Agent 自主完成从执行到校验的全过程。核心在于从“写提示词”转变为“设计终止条件和校验机制”,详细拆解了触发器、执行层、校验器、停止规则等六个关键组件,强调了明确终态和范围约束的重要性。
本文属于「AI 时代的编码新范式」系列,旨在解答在 AI Agent 开发中如何编写 Spec。文章首先厘清了 Spec 与 PRD、设计文档及用户故事的区别,指出 Spec 应定义软件行为而非描述需求。接着提出了 Spec 的五要素:目标、约束、边界、验收标准和技术上下文。最后倡导从三句话开始,将 Spec 视为随项目生长的活文档,以提高 Agent 开发的准确性和安全性。
本文是《人工智能的工程全景》系列的下篇,深入探讨了2025-2026年AI行业的竞争焦点——Agent工程层。文章从Agent定义的演变出发,区分了Workflow与Agent的本质差异,解析了ReAct架构与关键能力清单。重点介绍了Function Calling的工业化起点、MCP协议带来的工具调用标准化,以及Context Engineering与Harness Engineering在Agent系统构建中的核心地位。
本文对美团发布的 LongCat-2.0 万亿参数大模型进行了深度技术拆解。文章涵盖了 MoE 架构与稀疏注意力(LSA)的优化、N-gram Embedding 的应用,以及在国产算力受限情况下的 6D 并行训练工程、超节点组网、推理加速等关键技术细节。
文章指出大多数开发者像使用初级工程师一样使用 Claude Code,缺乏有效的流程。作者提出了一套利用 Claude Code 内置原语(Plan Mode、Subagents、Hooks 等)构建的 9 步闭环流程,旨在模拟资深工程师的工作方式。该流程强调在编写代码前先探索代码库并制定计划,使用 CLAUDE.md 固化标准,利用 Hooks 强制执行不可协商的规则,并通过独立 Agent 进行代码审查,从而实现高质量、自动化的代码交付。
文章指出许多人学习 AI Agent 时陷入了“工具焦虑”,盲目追逐 LangChain、MCP 等框架,却忽视了 Agent 的本质是一套围绕目标运行的系统。作者强调,真正的难点在于系统设计——理解工具调用、记忆、反馈修正及工程化约束,而非仅仅跑通 Demo。文章推荐 GitHub 项目 agent_learning,主张从 LLM 基础、Prompt 等底层原理开始,逐步构建从基础到工程化的完整知识体系,最终实现 Agent 在真实环境中的稳定运行。
本文介绍如何利用 Claude Fable 5 模型构建具有复合能力的自我改进 Agent 系统。文章首先澄清了 Fable 5 作为 Mythos 级模型的定位,强调了其支持“长周期自主会话”和“自验证”的核心能力。作者指出,真正的自我改进并非模型权重的更新,而是通过 loops、dynamic workflows 和 routines 这三种原语,构建起包含记忆层和评估反馈层的环境架构。文章还详细阐述了如何根据任务复杂度在 Fable 5、Opus 和 Sonnet 之间进行成本最优的路由配置。
文章描述了一位拥有10年经验的金融支付后端工程师,如何目睹自己多年积累的专业壁垒(领域知识、调试能力、代码品味)被 LLM 一一瓦解。从最初将 AI 视为“随机鹦鹉”,到后来承认 Claude Code 等工具在重构和排障上的统治力,作者深刻意识到:当经验变成可提示的数据,资深工程师的稀缺性正在消失,行业竞争正回归通才赛道。
文章指出 AI Skill 在应用中常因大模型的不确定性导致运行不稳定和 Token 消耗过高。作者提出应将确定性流程(如固定代码、参数)沉淀为脚本,仅让大模型负责逻辑判断与调度。通过视频字幕处理案例,详细演示了四步工程化法,并提供了可直接复制的工程化提示词,帮助用户实现流程稳定化与成本优化。
文章探讨了在使用 AI 辅助开发时,除了产品本身外,还需要构建一套支持智能体的“挽具”系统。作者将其定义为包含上下文、来源、能力、工作流等八个支柱的持久层,旨在解决 AI 缺乏项目知识、无法追溯原因、无法实际操作等常见问题,从而实现人机高效协作。
本文是一份面向开发者的 AI 产品构建实战指南。作者指出,仅将 AI 作为自动补全工具在复杂项目中会失效,真正的变革在于构建一套可复用的 'Harness' 系统。文章详细介绍了如何通过 .agent 目录结构(包含 AGENTS.md、SKILLS 等)将任务规格转化为可执行的软件,涵盖从规划、实现到验证的核心循环,并提供了适用于 SaaS、MCP 服务及 iOS 应用的通用工作流模板。
文章详细介绍了作者团队构建端到端 LLM 训练平台(Catalyst)的技术历程。通过解决数据标准化、超参数自动配置、多 GPU 提供商调度及无服务器环境下的长时训练恢复等挑战,实现了用户一键微调模型的愿景。
文章作者 lauren 分享了加入 Cursor 前后的编码体验对比,从使用 Claude Code 转向 Cursor,并深入探讨了如何通过 GUI 优于 CLI 的设计以及多模型对抗来提升效率。重点介绍了其开源的 pstack 插件,该插件通过一套严谨的技能和工作流,教导 AI Agent 像资深工程师一样进行二分法调试、代码审查和深度工作,以解决 AI 编码中常见的“平庸且快速”问题,倡导深度优于广度的 Agent 编排理念。
本文深入探讨了 Agent Harness 的概念,即包裹在 LLM 外部、将无状态模型转化为可用智能体的完整软件基础设施。文章引用了 Anthropic、OpenAI 和 LangChain 的实践,详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、记忆系统、上下文管理、验证循环等),并阐述了如何通过优化这层“操作系统”来解决遗忘、工具调用失败和上下文腐烂等工程难题。
文章以一个垂直 Agent 创业公司因使用 Markdown 文件管理内存而导致架构崩溃的真实案例为引子,深入探讨了在构建生产级、多用户、多 Agent 系统时,简单文件存储无法解决的五大核心难题:细粒度权限控制、并发写入冲突、时态查询准确性、可追溯的自我改进机制,以及海量数据的检索效率。作者指出,虽然 MD 文件适合早期原型,但一旦系统规模扩大,开发者往往会不自觉地重新发明数据库,这实际上是倒退。
本文旨在探讨如何像管理代码一样管理 Claude Code 的配置目录 .claude/。文章首先指出了混乱的目录结构会随着项目增长导致维护困难,随后提出了一套包含 CLAUDE.md、settings.json、rules/、hooks/、commands/、skills/ 和 agents/ 的标准化目录蓝图。接着,文章详细阐述了核心原则,包括顶层设计的轻重分离、规则模块化、自动化脚本与复用工作流的区别,以及团队与个人配置的边界。最后提供了从简单到复杂的渐进式成长路径,帮助开发者构建可预测、可维护且易于团队协作的 AI 辅助开发环境。
本文指出构建 AI 产品的核心不在于选择模型,而在于架构设计。作者分享了 10 个实用经验,强调从工作流而非模型入手、重视检索优于微调、将提示工程视为系统工程、关注延迟优化、为智能体设置护栏、妥善处理记忆、建立评估管道以及优化成本。最终,多智能体系统将是未来趋势。
本期早报探讨了 AI 编码从「工具替换」走向「工程化」的范式转变。Cursor 发布 Composer 2.5 并公开训练栈,标志着竞争从应用层下沉到模型层;Anthropic 工程师详解长时 Agent 架构,利用对抗式生成-评估循环将续航提升至 12 小时;阿里云 CIO 则提出应摒弃「AI 生码率」,关注端到端业务价值,指出代码即是负债。文章强调,模型能力、Agent 架构与组织效能三者结合,才能实现从写得快到做得对的跨越。
本文深入探讨了多智能体协作的工程实现细节,指出其并非简单的模型实例多开,而是涉及任务调度、状态管理等复杂机制。文章详细分析了 Codex、Claude Code、OpenClaw 等系统在触发方式(显式/语义/路由/队列)和拓扑结构(星型/链式/树型等)上的设计差异,并拆解了调用链中的关键环节。作者强调了显式控制、上下文隔离及 Merge 策略在构建高效多智能体系统中的重要性。
作者分享了大厂 Leader 将面试准备工程化的经验:利用 AI SKILL 自动解析简历并生成项目深挖、基础、算法及 AI Coding 四类题目,从而将个人精力从重复执行转移至核心判断与补课上。文章指出该方法虽然将准备时间优化至 20 分钟,但对面试官的追问能力和知识广度提出了更高要求。最后,作者针对暑期实习招聘给出了三条建议:把握窗口期赶早不赶晚、切忌盲目试水以免留下负面记录、以及技术为本需适当展示亮点。
文章介绍了 Andrej Karpathy 验证过的 CLAUDE.md 配置方法,该项目在 GitHub 上获得 8.2 万星标。文章分析了开发者在使用 Claude Code 时常遇到的三个痛点:重复解释上下文、AI 擅自修改代码范围、以及缺乏持久记忆。通过在项目根目录创建包含 Defaults、Behavior 和 Memory/Stack 三个部分的 CLAUDE.md 文件,开发者可以将编码准确率从 65% 提升至 94%,并为团队节省大量因沟通和回滚错误造成的时间成本。
本文探讨了在 AI 编程时代开发者面临的认知危机。作者指出,过度依赖 AI 生成代码会导致认知能力下降和技能退化,即“认知债务”。文章引用多项研究证实,虽然 AI 能提高短期效率,但会削弱长期理解力和调试能力。作者建议调整使用 AI 的姿势,如先形成假设、先询问原理或开启学习模式,强调在“交付”与“学习”之间取得平衡,避免为了当下的速度而牺牲未来的核心竞争力。
文章介绍了一项关于 Agentic Harness Engineering (AHE) 的研究。该框架通过自动进化工具、中间件和记忆等 Harness 组件,在不修改底层模型或提示词的情况下,显著提升了编程智能体的性能。实验表明,AHE 在 Terminal-Bench 2 上将 pass@1 从 69.7% 提升至 77.0%,并在 SWE-bench-verified 上表现出更高的成本效率。研究还发现,仅依赖提示词优化反而会导致性能下降,而工具和中间件的进化才是性能提升的关键。
文章探讨了 Claude Code 在处理数百万行级单体仓库及遗留系统时的成功模式。区别于传统 RAG 工具的嵌入索引滞后问题,Claude 采用本地代理式搜索实时导航。核心论点指出,工具链生态(CLAUDE.md、钩子、技能、LSP 集成等)的重要性远超模型本身。文章详细解析了七大扩展点,并建议通过渐进式配置与插件分发来提升在大型复杂代码库中的协作效率。
本文分析了 Andrej Karpathy 关于 LLM 输出 HTML 格式的观点。Karpathy 从神经科学角度指出,视觉是 AI 偏好的输出,HTML 是通往未来“神经模拟”的必经之路。作者结合自己的观察,对比了用户行为与科学原理的异同,并提出了 Karpathy 未尽的两个观点:一是输入端(人机交互)的滞后,二是 HTML 可能因工程上的局部最优而长期存在,不仅是过渡方案。
文章深入探讨了“AI Agent Harness”的概念,即包裹在大语言模型之外、使其转变为智能体的完整软件架构。作者详细拆解了生产级 Harness 的 12 个核心组件(如编排循环、工具、记忆、上下文管理等),对比了 Anthropic、OpenAI 和 LangChain 的不同实现路径,并指出 Harness 工程是决定 AI 应用性能的关键。
文章指出 AI 正从简单的“聊天机器人”演化为复杂的“操作系统”。作者深入剖析了 Claude Code 的 Agent Development Kit 架构,该架构包含五层设计:作为记忆层的 CLAUDE.md、作为知识层的 Skills、作为护栏的 Hooks、用于委派的 Subagents 以及用于分发的 Plugins。这套蓝图将 AI 转变为具备记忆、规则、委派和编排能力的数字组织,标志着开发重点从提示词工程转向了 AI 基础设施工程。
文章深入探讨了如何充分利用 Claude Code 的能力,指出真正的规模化不在于优化提示词,而在于构建围绕 Agent 的工程系统。核心内容包括利用 `.claude/` 目录建立持久化项目记忆、区分项目与个人配置、使用模块化规则替代巨型提示词、通过 Hooks 拦截危险操作、构建专用子代理以及配置权限边界。文章强调未来的开发将从“聊天”转向“编排”,通过环境设计来确保 AI 行为的一致性与安全性。
本文基于前两篇的概念基础,深入探讨了如何利用软件工程标准从零构建一个“工业级” Skill。文章以开发一个多平台图文社交文案生成 Skill 为例,详细拆解了 Skill 的定义与路由、目录结构规范、frontmatter 契约设计,以及如何利用 references 分离长知识。此外,作者还介绍了 skill-creator 和 superpowers 等辅助工具,并强调了“用例驱动”的测试方法、边界处理以及防范 Prompt Injection 的安全审查实践。
本文指出很多人将AI当作万能工具导致工作流断裂的问题,主张应采用“Agent in the loop”的思维,将AI视为生产系统的一个环节。作者以产品经理视角,分享了如何通过建立知识底座、拆解复杂任务和设计SOP来重构AI工作流,强调设计容错机制比追求完美工具更重要,并提供了独立开发全流程中AI的具体实践案例。
文章介绍了一个用于大型任务(如系统构建、功能开发)的 AI Agent 通用提示词模板。该模板旨在规范代理的工作风格与质量标准,要求其像资深工程师一样,深入理解上下文、制定计划、充分调用工具并进行严格测试。文章详细列出了从建立任务、收集背景、编写计划到执行纪律的具体步骤,强调不妥协的质量和持续迭代。
文章深入探讨了如何编写高质量的工业级 Skill(AI 技能/工作流)。文章指出 Skill 不同于简单的 Prompt,它需要具备按需加载、限制工具边界、配置适配模型、分层管理内容(SKILL.md 与 references/scripts 分离)以及建立评估测试闭环等特性。通过遵循最小权限原则、渐进式披露和迭代验证,可以将经验固化为稳定、可维护的自动化工作流。
本文探讨了在利用 Claude Code 和 Codex 等 AI 编程代理进行“氛围编程”时,如何构建高可维护性的 TypeScript 代码库。文章提出了“Harness Engineering”的概念,强调通过 Monorepo 结构、统一的 ESLint 配置、标准化的 Skill 文件夹结构以及详尽的 CLAUDE.md 文档,为 AI 代理提供明确的“行动线索”和约束机制,从而避免产生难以维护的“AI 垃圾代码”。
文章指出 AI 领域正发生范式转移:模型不再是产品核心,Agent Harness(控制框架)才是。LangChain 等团队通过优化 Harness,在不改变底层模型的情况下显著提升了性能。随着模型能力的趋同和商品化,竞争壁垒已转移到包含工具调度、上下文管理、沙箱和评估逻辑的工程化框架上。作者建议企业应从单纯的 Agent 开发转向定制化 Harness 的构建,以实现真正的产品化落地。
文章介绍了一款名为 gstack 的 AI 开发工具,它不同于普通的代码生成工具,而是通过定义“思考→计划→构建→审查→测试→发布→复盘”的完整链路,将 AI 转变为一个具备纪律性的开发团队。作者深入分析了 gstack 在需求澄清、方案收敛、代码审查及真实 QA 方面的优势,并探讨了将其方法论迁移到 Hermes 技能体系中的具体路径与价值。
Total TypeScript 作者 Matt Pocock 开源了其个人常用的 16 个 Claude Code Skill,GitHub 星标迅速突破 38k。这套工具主张“真工程师”模式,摒弃了 BMAD 等重流程框架,采用“小、可改、可组合”的 Unix 哲学。文章详细解析了针对 Agent 失败四大根因(需求模糊、啰嗦、代码报错、屎山)的解决方案,重点介绍了 CONTEXT.md 建立项目共享语言的方法,适合具备工程基础的开发者提升 AI 编码效率。
文章介绍了作者开发的“自愈 Agent Harness”系统,该系统通过 AI 代理实现了自动化评估和修复闭环。它包含三个核心组件:用于实时评分的三法官评审团、将低分转化为修复工单的工程管道,以及由 AI 评分控制发布的灰度发布机制。这一系统替代了传统的 QA 和人工审查,使团队能够在每天发布 3-8 次的高频节奏下,自动发现并修复模型幻觉、工具契约漂移或基础设施故障等问题。