BestBlogs 早报 · 07-29|MCP 无状态化与多智能体编排成本
本期早报探讨 MCP 协议的无状态核心变化与 Claude 的生产化接入,分析 Codex 与 ChatGPT Work 共用的执行框架差异,并审视多智能体并行中上下文搬运的隐性成本“编排器的税”。同时涵盖图工程、vLLM 商业化及 Uber 零增长架构等速览内容。
本期早报探讨 MCP 协议的无状态核心变化与 Claude 的生产化接入,分析 Codex 与 ChatGPT Work 共用的执行框架差异,并审视多智能体并行中上下文搬运的隐性成本“编排器的税”。同时涵盖图工程、vLLM 商业化及 Uber 零增长架构等速览内容。
文章解读了 Andrej Karpathy 关于构建自我改进多代理图的 12 页指南。核心内容包括 Loop、Chain、Swarm 等架构模式,以及利用知识图谱作为共享内存的重要性。文中对比了 Karpathy 的工程实践与 Anthropic 的动态工作流,强调了未来 AI 应用的壁垒在于图谱工程和多智能体协作。
文章介绍了作者使用 Herdr 和 Hermes Agent 构建的多智能体工作流。Herdr 作为类似 tmux 的多路复用器统一管理多个 AI 编程代理,Hermes 则作为开源的总部代理负责驱动其他代理。作者分享了三个实用技巧:基础编排、技能创建以及状态检查汇报,从而将混乱的终端窗口转化为高效的系统。
文章介绍了Codex中多智能体编排的实际应用,包括如何通过Sol和Terra模型协调任务、分配角色以及管理上下文继承。还提供了实用技巧,如使用Skill模式优化智能体协作和调整推理工作量。
文章介绍了一个由多个专业 Agent 组成的图系统,用于自动化商业机会扫描、分析和验证。该系统通过并行处理和独立验证机制,解决了人工研究效率低的问题,仅在发现高质量机会时唤醒用户。
文章阐述了如何利用图结构而非简单的循环来管理 AI 代理团队。核心在于“钻石模式”:任务并行分发、执行、独立验证与汇总。这种模式通过分散推理过程,提升了效率和准确性,并强调了人工检查节点的重要性。
文章介绍了2026年构建AI团队的完整指南,强调多智能体协作模式。通过设定研究员、起草人、批评家和润色者四种角色,利用Bloome等工具实现高效的AI工作流。涵盖市场调研、内容创作、文档审查等实际应用场景,并提供任务路由系统的具体配置方法,帮助用户低成本提升效率。
本期早报深入探讨 AI 系统工程化落地:Anthropic 研究量化了不同模型和语言中的价值观差异;淘宝直播分享了通过拆分多智能体来解决奖励归因难题的实践;微软则从企业视角提出了包含五层的生产 Agent 框架。此外,速览涵盖 OCR 模型、编码成本对比及国产大模型进展。
文章介绍了一种名为 MAD-OPD 的新算法,旨在解决 OPD(On-Policy Distillation)中单教师模型存在盲点导致学生模型学习受限的问题。通过引入多智能体辩论机制,让多个教师围绕学生状态互相纠错并达成共识,再进行蒸馏。实验表明,该方法在 14B+8B 到 4B 的蒸馏任务中,不仅提升了代码生成能力,还在 Agentic 任务中实现了小模型反超大教师的突破。
这是一份关于如何利用 Hermes 的 Profile 机制构建多智能体协作群聊的实操教程。文章详细介绍了配置 1 个主 Agent(Leader)和 3 个辅助 Agent(数据、技术、市场研究员)的完整流程。内容涵盖了 Profile 创建、共享 API 密钥配置、角色 Prompt 编写、Discord 机器人对接以及发言顺序控制与成本优化策略。
本文深入介绍了 Nous Research 开源项目 Hermes Agent。文章详细解析了其独特的“学习闭环”架构,该架构结合了三层持久化内存、自进化技能系统以及 GEPA 优化引擎,解决了传统 Agent 随会话结束而遗忘的问题。文中还将 Hermes 与 OpenClaw 进行了对比,并提供了从零开始配置多个个性化 Agent(程序员、研究员、设计师)的实战教程,旨在帮助开发者打造能够 24/7 运行且持续学习的个人 AI 队伍。
文章指出了当前 AI 辅助编程中“Vibe Coding”的痛点,即单一 AI 会话承担过多角色导致错误累积。作者提出了“软件工厂”的解决方案,通过构建包含代码库研究员、需求撰写者、规格撰写者、后端/前端构建者及测试验证者的 7 个专业化 Agent,将任务拆解并隔离。这种结构化流程利用 Claude Code 实现了自动化且高质量的功能交付,彻底改变了单人监督 AI 的低效模式。
文章介绍了一种利用 Codex 创建两个子智能体(逆向提示词智能体 A 和监督智能体 B)的方法,通过 A 生成提示词、B 生图并对比找差异的循环迭代机制,将任意图片精准逆向为可复用的文生图提示词。实验表明,通过 3 轮迭代,成功将风格描述升级为版式锁定和视觉重心的精确约束,实现了 95 分的高保真复刻。
本文深入探讨了多智能体协作的工程实现细节,指出其并非简单的模型实例多开,而是涉及任务调度、状态管理等复杂机制。文章详细分析了 Codex、Claude Code、OpenClaw 等系统在触发方式(显式/语义/路由/队列)和拓扑结构(星型/链式/树型等)上的设计差异,并拆解了调用链中的关键环节。作者强调了显式控制、上下文隔离及 Merge 策略在构建高效多智能体系统中的重要性。
作者通过实验发现,仅靠简单的 Ralph 循环(重复运行相同提示词)来驱动长运行 Agent 效果有限,容易导致歧义累积和目标偏离。文章指出 Codex 的 /goal 功能虽然解决了中断问题,但存在方向性偏差和缺乏反馈的缺陷。为此,作者提出了一套更优的工作流:在开始编码前进行严格的“设置阶段”,通过 /interview 命令让 AI 提问以消除模糊性;并采用多智能体协作模式,利用编排器管理子团队,以提高任务完成的质量和准确性。
文章探讨了在大语言模型时代,如何权衡使用单智能体与多智能体系统。引用斯坦福及Google/MIT的研究指出,多智能体系统并非总是更优,往往伴随着更高的计算成本、延迟和通信开销,且在“思考预算”相当的情况下,优化后的单智能体常能胜出。文章建议将单智能体作为默认起点,仅当任务涉及大量工具、上下文退化严重、存在自然解耦边界或需严格合规验证时,才考虑引入多智能体架构。
文章探讨了2026年主智能体管理子智能体的四种模式,按控制权递增排序:内联工具、并行分发、消息池和编排。这些模式包括简单的函数调用、并发任务生成、持久化有状态的消息通信以及全面的生命周期控制,分别适用于从简单的代码审查到复杂的多步骤协作工作流。
本文探讨了单提示词 LLM 工作流的局限性,并介绍了 NYU 研究者测试的四种多 Agent 编排架构:顺序流水线、并行分发合并、分层主管-工人模式以及反思式自纠循环。文章详细分析了每种模式的技术原理、优缺点、Token 效率及适用场景,指出分层模式在成本与精度间最平衡,而自纠模式虽精度最高但成本高昂且难以扩展。
文章综述了本周五篇重要的 AI 论文。1. Agentic Harness Engineering 提出了可验证的三层演化模型,显著提升了编程 Agent 的 Pass@1 率;2. AgenticQwen-30B 展示了高效的 MoE 模型在工具使用任务上的能力;3. Agentic World Modeling 提出了按定律分级的世界模型分类法;4. RecursiveMAS 通过潜空间递归计算解决了多 Agent 通信的 Token 膨胀问题;5. OneManCompany 探索了动态人才市场的多智能体协作模式。
文章深入探讨了 Claude 中的两种多智能体范式:Sub-agents 和 Agent Teams。Sub-agents 类似于独立上下文的临时工,适合并行处理孤立任务;而 Agent Teams 是持久化的协作团队,通过共享状态和直接通信解决复杂协调问题。文章建议根据任务所需的上下文依赖性选择架构,并介绍了五种主要的编排模式,强调应基于上下文而非角色来拆分任务。
文章推荐了 27 本构建 Agent 时代认知地基的书籍,涵盖底层范式、认知科学、决策理论、多智能体协作、组织管理及哲学对齐六大板块。作者强调 Agent 时代的盲区在于认知层,建议按需阅读,认为读完这些书能看穿当前 90% 的 Agent 创业本质是在重复旧思想。
文章深入探讨了如何在2026年构建高效的多智能体编码工作流。作者指出,顶尖开发者不再局限于单一工具,而是根据任务成本和需求在模型间路由。文章重点介绍了开源的 Kimi K2.6 及其终端代理 Kimi Code,它具备媲美顶级模型的推理能力,但成本仅为 Claude 的 1/7。作者详细展示了安装配置过程、API 开发与重构测试,并分析了其 MCP 兼容性及创新的 Agent Swarm 并行处理能力。
本文探讨了 AI 系统中“子代理”与“代理团队”的区别。子代理适用于并行、隔离的任务,专注执行且无状态;代理团队则用于需要上下文共享的协作任务。文章指出架构设计应基于上下文边界而非单纯的角色拆分,并总结了 Prompt 链、路由、并行化等 5 种关键模式。
文章探讨了 AI Agent 架构的演变。作者认为传统的单体 Agent 因 Token 成本过高和缺乏专业化而失效,基本单元应从“Agent”转变为更小的“Worker”。文章介绍了由 Worker、Function 和 Trigger 组成的全新编排模型,实现了更高效的模块化开发、灵活的架构模式以及安全运行时。
文章对 2026 年上半年三款国产旗舰大模型(智谱 GLM-5.1、阿里 Qwen 3.6 Max、月之暗面 Kimi 2.6)进行了深度横向对比。分析涵盖核心技术参数、能力评测及商业定价,指出各模型分别在自主编程、通用全能与长文本协作领域的优势,并针对不同业务场景提供了具体的技术选型建议。
文章详细介绍了 Kimi 新上线的「Claw 群组」和「Agent 集群」功能。作者通过构建一个包含 Kimi 指挥和多位投研 AI 助手的群组,演示了多智能体如何通过并行工作、互相质疑和角色分工来完成复杂的投资分析任务。文章指出,这一功能标志着 AI 从个体智能迈向群体智能,让普通用户也能像管理团队一样调度数字员工,极大地提升了工作效率和产出质量。
本文是一篇关于 Hermes 多代理系统的深度操作指南。作者指出,单个代理承担多种角色会导致声音模糊和上下文污染,而简单的角色划分也难以维持长期的一致性。文章提出了基于“隔离配置文件”的解决方案,详细介绍了构建包含编排者、研究员、作家和工程师的四人团队步骤。重点阐述了通过“交接契约”、内存 KPI 审计和策略门禁来建立“操作员层”,确保团队在运行 30 天后依然保持专业分工和清晰边界,避免多代理系统退化为单一混乱体。
本文介绍了如何利用Telegram新的Bot-to-Bot能力,让Hermes和OpenClaw两个Agent在同一群组中协作。文章详细讲解了从创建专用Planner Bot、配置权限、接入本地服务,到制定协作规则和验证连通性的完整流程,并展示了互传技能、联合审稿等实际应用场景。
文章探讨了如何利用 Hermes 的 Profile 功能构建多智能体团队,主张通过隔离状态(记忆、会话、配置)来避免单一大模型的上下文混乱。作者提出了一种包含协调员、研究员、作家和工程师的四角色团队结构,并详细讲解了如何使用 `hermes profile create --clone` 等命令实现这一架构,以实现更持久的专业化分工。
本文翻译自 Anthropic 官方博文,深入解析了多智能体协作的五种主流模式:生成 - 验证者、调度 - 子智能体、智能体团队、消息总线及共享状态。文章详细阐述了各模式的运作原理、适用场景与局限性,并提供了在代码审查、安全运营、系统迁移等实际案例中的选择建议。通过对比分析,帮助开发者根据任务特性(如上下文需求、事件驱动性、协作紧密度)灵活选择或组合模式,以构建高效、可扩展的多智能体系统。
这是一份关于构建生产级 AI 智能体的完整指南。文章详细阐述了智能体与聊天机器人的本质区别,涵盖了从工具设计、系统提示词、多智能体编排到生产环境部署、测试评估的全流程。重点介绍了如何利用 API 构建可靠的智能体循环,并指出了初学者常犯的错误及生产环境下的监控与成本控制策略。
文章深入剖析了将无状态 LLM 转变为功能强大的智能体所需的“代理框架”基础设施。内容涵盖编排循环、工具工程、内存、上下文管理、安全护栏及子代理编排等 12 个核心组件。文章对比了 Anthropic、OpenAI 和 LangChain 的实现策略,指出生产级应用的关键在于模型周围的工程架构,而非模型本身。
本文介绍了 OpenAI Codex CLI 的增强工具 oh-my-codex (OMX)。OMX 是一个智能工作流增强层,通过需求澄清、规划审批、持久完成循环和多智能体协调等工程化功能,解决了传统 Codex 缺乏工作流管理的痛点。文章详细讲解了 OMX 的核心功能、安装步骤、四大工作流模式($deep-interview, $ralplan, $ralph, $team)以及实战案例。
本文探讨了智能体系统中技能实现的局限性,指出技能不应是静态提示,而应是动态的情境行为。作者介绍了在 Slate 系统中通过引入“线程”和“分叉”机制,实现了上下文隔离的自动化技能调用,并提出了“编排技能”的概念,即通过组合其他技能来完成复杂任务链。
本文分享了 Claire Vo 如何利用 OpenClaw 实现生活与工作自动化的经历。从最初的硬核怀疑论者到拥有9个专用 Agent 的深度用户,她采用多 Agent 分工、精细化 Soul 文件配置及渐进式授权策略,成功将销售、家庭管理及课程开发等琐事自动化,极大提升了效率与自由度。
本文探讨了如何通过改进编排框架来解决 Claude 在长时间运行任务(如前端设计和全栈开发)中的局限性。作者受 GAN 启发,设计了包含规划器、生成器和评估器的多智能体架构。通过引入上下文重置机制、制定明确评分标准以及分离生成与评估环节,该框架成功实现了自主构建高质量全栈应用的能力,显著优于单智能体模式。
本文基于 Anthropic 工程师的实战指南,探讨了如何通过多智能体系统(Multi-Agent System)解决单一 AI 模型在处理长时复杂任务时的上下文退化和自我评估偏差问题。文章通过对比单智能体($9/20分钟)与三智能体系统($200/6小时)在游戏开发中的表现,引入了类似 GAN 的“生成-评估”协作机制。详细介绍了包含规划者、实现者和评估者的全栈开发架构,并提出了系统设计应随任务复杂度和模型能力演化的核心原则。
本文详细介绍了如何基于 OpenClaw 框架,从单助手改造成一套多角色协作系统。文章涵盖了总体架构设计(单 Gateway + 多 Agent)、消息路由策略、会话隔离机制、群聊协作编排以及双轨治理(配置+提示词)等核心技术点。通过定义 5 个独立角色并实现记忆分层与标准化 Workspace,实现了像真实团队一样的高效 AI 协作。