Agents Need a New Kind of Web Search
文章探讨了当前 AI Agent 在使用传统网页搜索时面临的“检索税”问题。传统搜索 API 仅返回链接和摘要,迫使 Agent 耗费大量 Token 去抓取和清洗内容。作者通过对比实验指出,使用预先爬取并结构化处理的索引(如 Seltz)能显著降低成本并提升效率,这种返回完整文档而非指针的方式是 Agent 搜索的未来。
文章探讨了当前 AI Agent 在使用传统网页搜索时面临的“检索税”问题。传统搜索 API 仅返回链接和摘要,迫使 Agent 耗费大量 Token 去抓取和清洗内容。作者通过对比实验指出,使用预先爬取并结构化处理的索引(如 Seltz)能显著降低成本并提升效率,这种返回完整文档而非指针的方式是 Agent 搜索的未来。
本文深入解析了Claude Code的“harness”架构,解释了为何简单的模型调用不足以构建可靠的代码代理。作者通过CrewAI框架逐步重建了包括核心循环、工具管理、规划机制在内的关键组件,揭示了通过工程化手段弥补模型差距的方法。
本文介绍了如何使用 Prime Intellect 的 Verifiers 框架从零开始构建一个用于强化学习(RL)的 Othello(黑白棋)游戏环境。文章解释了 RL 循环的基本组成部分(状态、动作、奖励、环境),并利用 GRPO 算法替代传统的人工偏好模型。文中详细展示了技术栈、游戏循环逻辑以及内置的 Minimax 对手引擎代码,旨在帮助开发者理解并掌握构建模型无关的 RL 环境的核心方法。
文章介绍了 Google 发布的 Agents CLI 工具,它填补了 Karpathy 所定义的“代理工程”中的工具链空白。该工具将脚手架搭建、评估循环和部署整合到一个工作流中,并将 7 种核心技能注入到 Claude Code、Cursor 等编码 Agent 中。作者演示了如何利用该工具从零开始构建、评估、部署并注册一个企业级 RAG Agent,实现了仅通过自然语言指令即可完成从开发到生产环境的全生命周期管理。
本文深入介绍了 Nous Research 开源项目 Hermes Agent。文章详细解析了其独特的“学习闭环”架构,该架构结合了三层持久化内存、自进化技能系统以及 GEPA 优化引擎,解决了传统 Agent 随会话结束而遗忘的问题。文中还将 Hermes 与 OpenClaw 进行了对比,并提供了从零开始配置多个个性化 Agent(程序员、研究员、设计师)的实战教程,旨在帮助开发者打造能够 24/7 运行且持续学习的个人 AI 队伍。
文章探讨了如何解决 AI Agent 记忆系统的多跳推理问题。传统的向量数据库在处理跨块事实连接时失效,而通用知识图谱常因缺乏结构导致查询噪音。作者提出的解决方案是使用 Pydantic 提前定义本体(Schema),明确实体类型、关系和属性。通过 Zep 框架强制执行这些约束,可以显著提升提取的准确性和数据的可查询性,从而实现有效的多跳推理。
本文是 Hermes Agent 的深度教程。Hermes 是一个能够在使用中不断自我进化的 AI Agent,与 OpenClaw 等其他 Agent 不同,它具备跨会话记忆、自编写/修剪技能以及通过 GEPA 引擎进行离线验证的独特能力。文章详细剖析了其包含 SOUL.md 身份层在内的三层记忆系统,并指导读者如何从零配置运行多个具备独立个性的 Agent。
文章指出 Claude Code 在网页抓取和后端集成(如 Supabase)方面存在两个主要盲点,导致 Token 消耗巨大且效率低下。作者介绍了两个开源工具来解决这些问题:Bright Data 负责高效抓取网页数据(包括 JS 渲染和反爬虫页面),InsForge 则作为后端上下文工程层优化数据库交互。作者演示了如何结合这两个工具,仅用一个 Prompt 就基于 YouTube 教程成功构建了一个包含 Google OAuth 和 AI 聊天功能的 Google Docs 克隆应用。
文章深入剖析了大语言模型(LLM)的推理过程。首先介绍了文本如何通过分词和嵌入转换为向量,接着详细解释了 Transformer 层中的自注意力机制与前馈网络如何协同工作。文章重点揭示了推理过程的两个不同阶段:处理输入时的“预填充”阶段受算力限制,而生成输出时的“解码”阶段受内存带宽限制,这种性能差异导致了首个token与后续token生成速度的不同。
文章介绍了 Berkeley 团队提出的 GEPA 算法,该算法作为 GRPO 的替代方案,无需更新模型权重或进行 GPU 训练,仅通过优化提示词(Prompt)即可在 HotpotQA 等基准测试中取得更优成绩。GEPA 的核心在于利用 LLM 读取完整的推理轨迹,通过自然语言反思来迭代优化多模块系统中的每个提示词,从而避免了强化学习中将丰富信息压缩为单一标量信号的信息损耗问题。
文章介绍了一种称为递归语言模型(RLMs)的新方案,旨在解决大语言模型在处理超长上下文时出现的“上下文腐烂”问题。RLMs 不再将上下文限制在单一 Prompt 中,而是将其视为外部数据,通过赋予模型窥探、正则匹配、分区和递归调用等工具,让模型自主决定如何分解和处理任务。这种方法不仅消除了上下文长度对推理能力的影响,还提高了准确性和成本效率。
文章介绍了如何构建一个完全开源、可本地部署的深度研究系统。该系统由 Onyx(检索层)、CrewAI(编排层)和 Voxtral(语音层)组成。通过三阶段执行流程、自适应策略和六阶段检索管道,Onyx 在 DeepResearch Bench 排名第一,超越了 OpenAI 和 Gemini。文章强调了数据隐私的重要性,并详细拆解了实现高质量自我托管研究的架构细节。
本文详细分析了 Claude Opus 4.7 与 4.6 的关键差异。新版模型采用了自适应思考机制、更严格的指令遵循以及 xhigh 默认算力等级。文章指出了升级后成本增加和召回率下降的原因,并提供了具体建议:采用“委托思维”而非“结对编程”模式,在首轮交互中明确任务意图,批量提问以减少推理开销,并针对 4.7 的字面义理解特性调整 Prompt 风格。
文章从第一性原理出发,深入探讨了 Agent 记忆机制的演变。作者指出单纯依赖 Context Window 会遭遇“中间迷失”效应,并借鉴认知科学将记忆分为感觉记忆、工作记忆和长时记忆。文章通过对比 Python 列表、Markdown 文件和向量搜索等不同技术层级的优劣,揭示了传统方案在持久性、语义理解和关联推理上的局限性,最终提出了结合图数据库和向量搜索的 Graph-Vector 混合解决方案。
文章深入探讨了LLM智能体的“记忆”难题,指出单纯增加上下文窗口无法解决“迷失在中间”效应及会话遗忘问题。作者基于认知科学框架,分析了从Python列表、Markdown文件到向量检索各阶段的局限性,强调构建兼具持久化、语义理解和关系推理能力的记忆层至关重要,最终引入了一个能够整合向量、图谱和关系存储的开源解决方案。
文章深入剖析了将无状态 LLM 转变为功能强大的智能体所需的“代理框架”基础设施。内容涵盖编排循环、工具工程、内存、上下文管理、安全护栏及子代理编排等 12 个核心组件。文章对比了 Anthropic、OpenAI 和 LangChain 的实现策略,指出生产级应用的关键在于模型周围的工程架构,而非模型本身。
本文深入解析了 Claude Code 中 .claude 文件夹的结构与功能。作为 Claude 运行的控制中心,该文件夹存储了指令、自定义命令、权限规则及会话记忆。文章详细介绍了项目级与全局配置的区别,阐述了 CLAUDE.md、rules/、commands/、skills/、agents/ 及 settings.json 的具体用法与最佳实践,帮助开发者配置专属的 AI 编程助手,提升团队协作效率。