ChatGPT Agent Loop 优化技术解析
本文深入解析了 ChatGPT 如何通过 Harness、API 和 Inference 三层架构优化 Agent 循环,重点介绍了持久化 WebSocket、增量 Token 化、KV 缓存管理和推测解码等技术,以降低成本并提升效率。
本文深入解析了 ChatGPT 如何通过 Harness、API 和 Inference 三层架构优化 Agent 循环,重点介绍了持久化 WebSocket、增量 Token 化、KV 缓存管理和推测解码等技术,以降低成本并提升效率。
本期早报探讨了 AI 智能体缩短实现周期后,创业者的机遇与挑战。文章涵盖 Sam Altman 对创业窗口的判断、GPT-5.6 的效率工程实践,以及如何通过 Skill Harness 将模型能力封装为可维护的产品功能。
本文介绍了大语言模型背后的数学原理,涵盖Attention机制、缩放因子、反向传播、梯度下降、交叉熵损失、RoPE位置编码和RMSNorm归一化等核心概念。
本文介绍了如何针对 Claude 5 系列模型(Fable, Opus & Sonnet)进行高效提示。文章涵盖了通用提示原则、Fable 的自主任务处理、Opus 的日常优化以及 Sonnet 的高效应用,帮助用户最大化模型生产力。
文章探讨了如何从构建单个智能体转向构建智能体工厂,以解决人工审核瓶颈问题。介绍了Sage决策模型在自动化质量控制和输出门控中的应用,提供了具体的实现思路和GitHub资源。
文章介绍了一条 4 个月从零基础成为 AI 工程师的学习路径。文章指出 AI 工程岗位增长迅速且薪资优厚,学位要求正在降低。作者强调职业转型者具备判断力和沟通能力的优势,并指出了初学者常犯的错误,如过早钻研理论、只看不练等。
文章介绍了缓存增强生成(CAG)作为一种替代经典RAG流水线的新方案。CAG通过将全部知识预加载到模型上下文并缓存KV Cache,显著提升响应速度,解决检索延迟和召回缺失问题。适用于中短篇幅静态文档,但对大规模或频繁变动数据仍需传统RAG或混合架构。
本文探讨了AI时代的“超级个体”概念,指出超级个体并非培训而成,而是由好奇心激发的AI Builders。文章回顾了互联网从独立软件时代到分工细化的工业化、平台化演变,认为LLM和Agent工具正在重新压缩分工,赋予个人闭环能力,大组织应调整人才策略以适应这一变化。
本文介绍如何超越个人知识库,构建一个“公司大脑”。通过将文件系统与 AI 智能体结合,设定文件夹作用域、定时任务和自动汇报,让智能体自动处理营销、文件归档等工作,实现无需人工干预的全自动企业级知识管理。
文章深入解析了 Matt Pocock 的 AI 工具 /grill-me 的核心逻辑。该工具并非让 AI 直接执行任务,而是通过一套追问协议,强迫 AI 先理清需求再行动,解决了 AI 瞎猜和抢跑的问题。文章进一步阐述了完整的 AI 协作五步法:质疑、规格化、拆票、TDD 和架构评审,旨在通过纪律约束防止 AI 失控,提升人机协作质量。
文章详细解读了 Anthropic 发布的 Claude Opus 5 模型及其官方提示指南。核心内容包括“Effort(努力)”设置的使用、从“怎么做”转向“为什么”的提示策略、删除验证指令以降低成本、以及如何控制响应长度和 Agent 叙述行为,旨在帮助用户最大化发挥模型效能。
本文探讨了2026年以来关于Agent运行位置的争论,指出行业趋势是将Agent运行在沙箱之外。作者详细解释了沙箱内运行的三个主要问题:爆炸半径、信任边界和沙箱的间歇性运行,并提出了将沙箱作为工具暴露的正确架构,最后提供了基于Vercel AI SDK的实现示例和生产环境中的挑战。
文章回顾了从 GPT-2 (2019) 到 KimiK3 (2026) 的大语言模型架构演进,重点对比了参数规模从 1.24 亿到 2.8 万亿的巨大跨越。深入解析了 GPT-2 的 Transformer 解码器结构、KV 缓存机制,并探讨了线性注意力机制在降低计算复杂度方面的原理与权衡。
文章通过三个真实案例,验证了“贵模型编排、便宜模型执行”这一省钱策略。作者发现,虽然便宜模型在文本判定等任务上能打平顶尖模型,但在高复杂度代码和开放式视觉任务上存在局限。关键在于控制模型能力代差和任务可验证性,否则返工成本将抵消节省的 token 费用。
本文深入探讨了 PagedAttention 和 RadixAttention 两种技术。PagedAttention 通过类似操作系统的分页机制管理 GPU 内存,解决 KV Cache 的内部和外部碎片问题,显著提升并发处理能力。RadixAttention 则利用基数树索引缓存的前缀状态,实现跨请求的计算和内存复用,进一步优化推理性能。
文章精选了本周 6 篇顶级 AI 论文,涵盖 Harness Handbook、MSCE 记忆技能框架、PRO-LONG 长程记忆机制、Anthropic 全局工作空间解释性研究、Meta 的 GAMUT 完整性基准测试以及渐进式披露模式。
本文深入解析了 GEO(生成式引擎优化)中的核心概念 Fan-out Rank。文章阐述了 AI 搜索通过查询改写和查询扩散将用户主查询拆分为多个子查询的机制,并详细介绍了如何利用 ICP 筛选出高价值的“金矿词”,以及通过结构化内容和外部信源建设来提升 GEO 流量的实操策略。
文章通过电力革命和PC普及的历史案例,指出AI短期内未提升生产率的原因在于工作流程未被重构。Databricks CEO通过案例说明,只有彻底改变组织流程和协作模式,才能释放AI带来的20倍效率提升。
作者分享了一个名为Leader.skill的开源工具,旨在解决Agent交互中目标定义模糊的问题。该工具基于“目标七问”方法论,将模糊需求转化为清晰的目标任务书,支持多模型组合(如Claude规划、GPT执行),显著提升长程任务的完成率与Token利用率。
文章介绍了 Graph Engineering,一种通过流程图协调多个 AI 协作完成复杂任务的方法。它将复杂任务拆解为节点、边和状态,解决了单 Loop 应对复杂任务时的局限性。文章详细解析了 Graph 的核心概念、与 Loop 的关系、四个核心模块及具体实践模板,并提供了新手学习路径。
文章介绍了利用AI构建和扩展单人企业的完整蓝图。通过使用AI员工(如Viktor)在内容、项目、拓展、财务和广告五个领域实现自动化,只需保留决策环节。文章探讨了两种构建方式:快速路径和自定义构建,强调业务知识库和操作规则的重要性。
Anthropic 团队将 Claude Code 的系统提示词删减了 80%,但编码评测没有损失。文章指出,许多规则是为老模型打的补丁,已过时。最佳实践转向:用锚点代替禁令,用接口设计代替举例,以及渐进披露。建议开发者清理“拐杖”型规则,保留护栏与品味,用评测集支撑删除决策。
Ryan Carson 分享了如何作为唯一员工,通过管理云端 AI Agent 团队日处理 40 个 Pull Request 的经验。文章详细介绍了将工作迁移至云端、建立工作节奏、将重复检查自动化以及控制 Token 成本四个关键步骤,强调在 AI 时代,优秀的工程管理能力比以往任何时候都重要。
文章探讨了计算历史上的专业化趋势,指出 AI 推理需求正在爆发,通用 GPU 已无法满足其对内存和能效的特定要求。文中以 Google 的 TPU 为例,介绍了定制化硬件的兴起。重点分析了初创公司 Etched 如何押注专用推理芯片,通过低电压推理和集群级内存技术,试图解决算力与能耗问题,抢占这一巨大的市场份额。
文章介绍了如何利用 CIA 的红队策略,通过 4 个特定的 Prompt 让 Claude 对你的点子进行残酷的压力测试。这种方法旨在通过识别关键假设、扮演魔鬼代言人等手段,克服认知偏见和 AI 的阿谀奉承,帮助你在浪费数月时间之前验证或否定想法,让点子变得无懈可击。
文章指出2026年AI工程师角色已分化为机器学习工程师和应用AI工程师。对于非CS学位求职者,后者是主要机会。文章详细列出了必备技能(Python、LLM行为、RAG系统、评估观测),并提出了三个能替代学历证明的实战项目建议。
文章分析了当前 AI 领域的“淘金热”——上下文管理。作者指出,从 Jevons 悖论到数据主权,多因素驱动了初创公司和大企业竞相构建公司大脑或 LLM 知识库。尽管切入角度各异(如个人知识库、代理内存、可观测性工具等),但核心目标一致:为未来的智能体劳动力提供数据上下文层。文章认为该领域潜力巨大,但也面临产品同质化。
文章作者分享了从单纯使用 AI 到让 AI 系统持续运行的转变。他通过编码代理管理目标、习惯和日志,利用 Plaud NotePin 记录日常想法,并使用 OBS 录像提高专注度。这种系统化方式不仅保留了工作状态,还显著提升了生活与工作的效率。
文章介绍了通过结合 Kimi K3 模型与图工程构建 AI 系统的方法。相比传统 RAG,该架构利用知识图谱存储实体关系,能处理复杂推理,实现成本降低85%和准确率提升18%。文章引用微软 GraphRAG 等研究,详细阐述了如何从零开始构建该系统。
文章探讨了超越传统提示词的多模态交互技术,提出“任务”概念,通过结合语音、屏幕、文本等多种信息源,让代理更高效地完成复杂工作。该方法减少交互循环,提升并行工作能力,并通过存储执行痕迹逐步转化为可重用的技能,为未来全模型交互奠定基础。
本课程教授如何构建 AI 智能体图,涵盖图的基本概念、关键模式(如菱形模式)、停止规则及人工审批环节。包含三个实战案例:深度研究台、SEO 内容生成器和市场推广套件,旨在提升业务效率并控制成本。
文章回顾了 LangGraph 三年来的发展,探讨了将智能体系统建模为图(Graph)的实践与价值。作者分析了何时使用图结构以平衡确定性与自主性,并指出生产级智能体通常需要循环和动态转换。最后,文章强调图工程并非全新概念,但随着节点的进化,现在的图更多是在编排智能体而非单一的 LLM 调用。
文章将60个AI行业专业术语进行了通俗易懂的翻译和解释,涵盖基础概念、训练调优、推理交互、工具扩展、评估安全及前沿趋势六个方面,帮助读者快速理解AI技术地图。
本文介绍了 Graph Engineering 的概念,即从线性的 Agent 循环转向图结构的工作流。文章详细讲解了如何利用 Claude Code 的动态工作流功能,通过五个步骤构建并行处理任务的 Agent 图,以解决上下文限制和执行效率问题,并探讨了在扩展到 1000+ Agent 时可能遇到的挑战及解决方案。
本文介绍了一种结合 Claude 和 Obsidian 的知识管理方案,通过自动化提取、链接和归档,将死笔记转化为可交互的第二大脑,支持全文检索和引用,帮助知识复利增长。
文章探讨了AI Agent从简单的ReAct循环向图工程架构的演进。循环模式在处理复杂、多步骤及需人工介入的任务时存在状态持久化、错误处理和分支逻辑的局限性。图工程通过显式的节点、边和状态管理,解决了并发、暂停恢复及复杂流程控制问题,为构建更健壮的Agent系统提供了架构基础。
本文讲述了作者深入 AI 独角兽 Moonshot AI(Kimi 母公司)内部进行 100 小时的观察记录。文章回顾了公司从早期的营销挣扎到面对竞争对手 DeepSeek 突围时的战略调整,展现了这家年轻、高估值且充满内向天才员工的神秘企业文化。
文章分享了作者使用LLM代理管理和维护个人知识库(Obsidian Vault)的3个月实践经验。通过分离原始资料与生成内容、定义单一知识流向、统一页面模板以及基于情境的文件夹组织,作者成功将维护工作委托给代理,解决了传统第二脑因维护成本高而失效的问题。
文章探讨了 LLM Wiki 模式的兴起,即通过在摄取时编译知识而非查询时检索,解决传统 RAG 无法积累知识的问题。介绍了 Cognition、FactoryAI、LangChain 等团队构建的 Agent Wiki 系统,分析了其架构原理及在维护成本上的优势。
本文介绍了AI Agent工程从Prompt到Loop再到Graph的演进。Graph Engineering通过图结构重新规划任务关系,实现并行处理、明确依赖、隔离失败,从而解决线性流程在复杂任务中效率低、易失控的问题。
文章解释了从“循环工程”到“图工程”的技术演进。循环是简单的单一代理执行模式,而图(由节点、边和状态组成)通过可视化的流程图处理复杂逻辑和多代理协作。文章介绍了如何使用 LangGraph 构建第一个图,并指出在逻辑变得复杂时应从循环升级到图。
文章指出在 Claude Code 中使用昂贵模型处理基础任务是浪费。作者介绍了三种方法将 Kimi K3 集成到工作流中:使用 Kimi Code、通过 CC Switch 在 Codex 中配置 K3,或使用 Codex Orchestration 插件进行角色级路由。通过将繁琐的代码实现交给便宜的 K3,仅将推理留给高级模型,可在保持质量的同时将成本降低 10 倍以上。
本文是一份关于 Hermes Agent 的 12 部分系列课程汇总,涵盖了从工作流程、学习系统、技能管理到多平台集成、浏览器控制等核心功能,详细介绍了该系统的架构设计与最佳实践。
作者分享了使用Linear工具管理编程Agent的实战经验。他将任务按结果层级组织,利用分流箱收集问题,并通过分批处理工作流来提高效率。文章重点强调了制定清晰的Ticket契约(目标、原因、结果)、确保Agent完整完成任务以及实现无监督并行工作,从而打造个人“软件工厂”以提升生活质量。
RW Research Skill 是一套包含18个独立AI技能的科研工具,通过路由器智能判断科研阶段,协助完成从研究问题界定、文献检索、数据分析到论文投稿的全流程。它能帮助研究者在24小时内启动并跑通第一个科研项目,解决科研流程中的顺序与效率问题。
本文通过 Python 演示了如何搭建一个具备规划、工具调用、验证和复盘能力的完整 LLM Agent。教程详细拆解了 Plan-and-Solve、ReAct、Verification、Self-Refine 和 Reflexion 五个核心模块,强调了结构化数据控制流程的重要性,并提供了工程落地的具体代码实现与原则。
文章提出了一种结构化的 Agent 沟通协议“Spec”,包含目标、完成标准、约束等 8 项必填清单。通过明确协议而非单纯依赖 Prompt 技巧,可显著降低 Token 消耗,提升任务一次性完成率,避免 Agent 猜测与无效返工。
作者利用Kimi K3模型,在不到一天时间内开发出一款对标ScreenStudio的免费macOS原生录屏App HuaStudio。文章详细记录了从需求分析、分阶段开发到解决系统级Bug的全过程,肯定了K3在长程规划、代码执行和Debug方面的能力,认为其体验接近Opus 4.8。
文章介绍了 Anthropic 推出的 Claude Skills 功能,通过文件夹和 YAML 配置实现渐进式披露,显著减少 Token 消耗和重复解释。详细说明了技能的构建规则、命名规范、测试方法及分发策略,帮助用户将聊天机器人转化为高效的专业工程团队。
文章详细解析了构建大型语言模型的五个关键阶段:数据收集与预处理、预训练、及后续阶段。作者指出,大多数误解源于将“训练”视为单一步骤,实际上每个阶段解决不同问题。理解这一流程有助于识别模型行为根源及局限性,如幻觉或拒绝回答,并指导优化策略。