AutoAgent:首个用于自优化代理框架的库 ✍ Kevin Gu🕐 2026-04-03📦 6.9 KB 🟢 已读 𝕏 文章列表 本文介绍了开源库 AutoAgent,这是一个能够自主优化任何领域代理的框架。通过引入“元代理”概念,AutoAgent 可以自动调整任务代理的提示、工具和编排逻辑,从而在 SpreadsheetBench 和 TerminalBench 测试中取得卓越成绩。文章探讨了“模型同理心”的重要性,并详细阐述了该框架如何通过拆分元任务与任务、利用推理轨迹以及避免过拟合来实现性能的持续提升。 AutoAgent自优化开源LLM元代理基准测试模型同理心自动化框架代码优化 # autoagent:首个用于自优化代理框架的库 **作者**: Kevin Gu **日期**: 2026-02-27T19:20:11.000Z **来源**: [https://x.com/kevingu/status/2039843234760073341](https://x.com/kevingu/status/2039843234760073341) ---  今天我们发布自动代理一个开源库,用于自主改进任何领域的代理。 AutoAgent 经过 24 小时以上的优化,在 SpreadsheetBench 测试中取得了 96.5% 的得分,位列第一;在 TerminalBench 测试中,其 GPT-5 得分也达到了 55.1%,同样位列第一。  排行榜上的其他所有条目都是精心设计的,而我们的不是。 代理程序一直受限于框架工程,但我们仍然在使用原始的网格搜索:调整、评估、读取错误跟踪、重复。 这是第一个确凿的证据,证明智能体可以在生产基准测试中自主地超越人工调优的性能。 代码可用这里 ## 它的功能如下 将 AutoAgent 指向具有评估的任务域。元代理在任务代理的框架上进行实验:调整提示、添加工具、改进编排,直到性能提升。 该装置的设计理念是极简主义: - 任务代理启动时仅包含一个 bash 工具。 - program.md 为元代理赋予了研究方向。 - agent.py 是任务代理 - Harbor 适配器连接到您的基准测试设备 元代理随后启动数千个并行沙箱来改进任务代理。24 小时后,它拥有特定领域的工具、验证循环和编排逻辑,所有这些都是自主发现的。 循环: > 1. 编辑代理的框架 > 2. 在任务上运行它 > 3. 衡量绩效 > 4. 读取失败跟踪 > 5. 持续改进,纠正失败 > 6. 重复 ## 为什么这种方法有效:像代理人一样看待事物 我们发现,智能体比我们更擅长理解智能体。 Claude Code 团队曾撰文探讨“像代理人一样思考”,即设身处地地站在模型的角度思考,并设计出适合其能力的工具。 我们常常将自身的直觉投射到推理方式不同的系统上。我们不擅长与模型进行共情。 AutoAgent 将这一点付诸实践。元代理读取任务代理的推理轨迹,并且已经对自身有了隐式的理解,包括自身的局限性和倾向。因此,当它发现任务代理在第 14 步迷失方向时,它会将这种故障模式理解为自身世界观的一部分,并进行纠正。 我们称之为“模范同理心”。 实际结果:Claude 元智能体 + Claude 任务智能体的性能优于 Claude 元智能体 + GPT 任务智能体。同模型组合之所以胜出,是因为元智能体能够利用内部模型的实际理解能力。它共享相同的权重,并且确切地知道该模型的推理方式。 当智能体的性能超越人类的 99%水平时,我们关于优秀安全带设计的直觉就成了错误的先验知识。像 AlphaZero 这样的智能体应该从第一性原理出发进行探索。 ## 我们未预先编程的涌现行为 - 抽查:针对小幅修改运行单独的任务,而不是运行完整的测试套件。这显著加快了迭代速度,节省了计算资源。 - 强制验证循环:构建确定性自检查和格式验证器。在任务主预算之外,额外预留了用于自我纠错的轮次,以及用于验证和纠正输出的奖励轮次。 - 编写测试:引导任务代理为每个任务构建自己的单元测试和检查。 - 渐进式披露:当结果溢出时,将过长的上下文信息转储到文件中。 - 编排逻辑:根据领域需求构建特定任务的子代理和交接机制 ## 结果  AutoAgent 在 SpreadsheetBench 测试中取得了 96.5% 的准确率,在 TerminalBench 测试中取得了 55.1% 的准确率,这两个分数均位列排行榜前列。该代理程序在超过 24 小时的自主迭代过程中,分析自身的故障轨迹并不断改进。 ## 我们学到了什么 拆分很有帮助。 我们尝试过让一个智能体自我提升,但失败了。擅长某个领域和擅长提升该领域的能力是不同的。元任务/任务拆分可以让每个智能体专精于特定领域。 轨迹至关重要。 当我们只给出分数而没有轨迹时,改进率大幅下降。理解改进的原因与知道改进本身同样重要。轨迹使元智能体能够解释任务智能体的推理过程——这正是实现精准修改的关键所在。 智能体过拟合。 元智能体变得懒惰,插入特定于评分标准的提示,以便任务智能体可以操纵指标。我们通过强制自我反思来限制这种情况:“如果这个任务完全消失了,这种改进是否仍然值得?” 元智能体的质量至关重要。 工具修改通常受到元智能体自身工具的启发。设计糟糕的元智能体会产生糟糕的任务智能体。Codex 作为元智能体表现不佳——它忽略了永不停止改进的指令(在自动研究中也观察到了这一点),导致最终的任务智能体过早放弃。 ## 为什么这很重要 构建智能体的难点在于:每个领域都需要不同的框架,而框架工程需要对领域和模型行为都有深刻理解的人员。 AutoAgent 简化了这一过程。领域专家只需定义成功的标准即可。元代理则负责找到合适的解决方案。 企业需要自动化的工作流程不止一个,而是成百上千个。每个工作流程都需要不同的解决方案。 没有哪个团队能够手动调整数百个线束。元代理可以做到。 这是代理集群的基础设施:持续启动、优化和维护整个组织内的特定任务代理。 ## 接下来会发生什么? AutoAgent 是我们内部开发的,但后来决定将其开源:https://github.com/kevinrgu/autoagent 描述规范,提交评估,让它不断攀升。每个人都应该能够做到这一点。 自我改进型智能体仍处于起步阶段。下一个前沿领域:利用智能体动态地、及时地为任何任务组装合适的工具和上下文。 我们很快就会发布一款相关的产品。评论区有抢先体验信息。 ## 相关链接 - [Kevin Gu](https://x.com/kevingu) - [@kevingu](https://x.com/kevingu) - [32K](https://x.com/kevingu/status/2039843234760073341/analytics) - [自动代理](https://github.com/kevinrgu/autoagent/tree/main) - [agent.py](https://agent.py/) - [Feb 28](https://x.com/trq212/status/2027463795355095314) - [3.9M](https://x.com/trq212/status/2027463795355095314/analytics) - [https://github.com/kevinrgu/autoagent](https://github.com/kevinrgu/autoagent) - [升级至高级版](https://x.com/i/premium_sign_up) - [7:11 AM · Apr 3, 2026](https://x.com/kevingu/status/2039843234760073341) - [32.5K Views](https://x.com/kevingu/status/2039843234760073341/analytics) - [View quotes](https://x.com/kevingu/status/2039843234760073341/quotes) --- *导出时间: 2026/4/3 11:00:23*
如 如何(以及为何)构建 Agent First 应用 文章介绍了如何使用 Agent-Native 框架构建 Agent First 应用。通过统一的前端动作与 Agent 工具,实现 UI 与 Agent 的双向同步。应用支持通过聊天交互、集成外部 Agent、A2A 通信及自动化任务,且完全开源。 技术 › Agent ✍ Steve (Builder.io)🕐 2026-07-29 AgentAgent-NativeClaude前端A2A开源自动化框架UI
浪 浪费20亿Token之后,我做了一个帮自己定义目标的Skill 作者分享了一个名为Leader.skill的开源工具,旨在解决Agent交互中目标定义模糊的问题。该工具基于“目标七问”方法论,将模糊需求转化为清晰的目标任务书,支持多模型组合(如Claude规划、GPT执行),显著提升长程任务的完成率与Token利用率。 技术 › Skill ✍ 数字生命卡兹克🕐 2026-07-27 AgentGoal Engineering目标定义自动化开源LLM效率工具方法论ClaudeGPT
H Horizon:开源 AI 新闻雷达,打造你的专属双语日报 介绍了一款名为 Horizon 的开源 AI 新闻雷达工具。该工具支持抓取 HN、Reddit、GitHub 等多平台一手信息,利用大模型自动打分、去重、总结,并生成中英双语日报。支持 Docker 一键部署及多种订阅方式,旨在解决信息过载和二手信息泛滥的问题。 技术 › 工具与效率 ✍ 开发者Hailey🕐 2026-06-28 AI开源新闻聚合效率工具HorizonDockerLLM资讯自动化Python
S Superpowers:Claude Code 效率暴涨 10 倍的秘密 文章介绍了 Claude Code 的开源技能库 Superpowers,它如同 AI 的导航系统,通过头脑风暴、计划拆解、子代理驱动开发和测试驱动四大核心工作流,自动引导用户从构思到上线。该系统有效降低了认知负荷,并通过严格的审查机制确保代码质量,是提升企业 AI 交付效率的利器。 技术 › Skill ✍ Miles.🕐 2026-05-22 Claude CodeSuperpowers工作流Agent测试驱动自动化开源效率工具开发实践LLM
O OpenClaw 终于有了一个能打的对手:Hermes Engine 全平台实测+迁移指南 本文深入评测了新兴的 AI Agent 引擎 Hermes Engine,视其为 OpenClaw 的强力替代品。文章指出 Hermes 在稳定性、记忆持久化和进度可视化方面显著优于 OpenClaw,且完美兼容 OpenClaw 的技能生态。详细提供了 Linux/Mac/Windows 全平台安装教程、数据迁移方法及 Telegram Bot 集成指南,推荐搭配 Google AI Studio 的免费 Gemma 模型使用。 技术 › Agent ✍ 0x小师妹🕐 2026-05-20 HermesOpenClaw教程实测开源自动化效率工具LLMAI评测
O OpenAI 正在确立 Coding Agents 的默认编排层 文章介绍了 OpenAI 生态内两个同时发布的开源项目:Symphony 和 ClawSweeper。两者均基于 Codex App Server 这一原始编排层,分别针对 SDLC 的两端(PR 创建与 Issue 维护)提供了参考实现。Symphony 将 Linear 转化为自动化代理系统,提升 PR 吞吐量;ClawSweeper 则能并行运行大量 Codex 实例,自动清理无意义 Issue。文章分析了它们的架构模式、应用场景及局限性。 技术 › Agent ✍ AlphaSignal AI🕐 2026-04-29 OpenAICodexCoding AgentOrchestrationSymphonyClawSweeperDevOpsLLM自动化开源
M Meet Scout: 开源的企业级上下文代理 本文介绍了 Scout,一个开源的企业级“上下文代理”(Company Brain)。针对现有方案将所有数据存入向量数据库导致索引过时的问题,Scout 提出了“导航优于搜索”的理念,通过 Context Providers 连接 Slack、Google Drive 等实时数据源,像操作文件系统一样导航信息。它还能动态构建 Wiki 和 CRM,并通过持续学习形成闭环。 技术 › Agent ✍ Ashpreet Bedi🕐 2026-04-29 Agent开源RAG上下文提供商企业知识库SlackCRMLLM向量数据库自动化
自 自动辅助:具有自动评估功能的自改进代理系统 NeoSigma 开源了‘Auto-harness’系统,这是一个自改进循环框架,能将代理失败转化为评估结果并自动修复。实验显示,该系统使 Tau3 基准任务得分提升了 40%。文章探讨了故障聚类、回归门控和子代理管理等关键技术,标志着工程重心从编写代码转向构建能够自我维持和改进的系统。 技术 › Agent ✍ Gauri Gupta🕐 2026-04-05 Auto-harness自改进开源评估系统NeoSigmaLLM自动化Agent
超 超强剧本Skill开源:一键出灵感、IP二创剧本、分镜表 作者开源了一个IP影视二创剧本方向及分镜表灵感生成器,能自动生成创作灵感、IP二创剧本及分镜表,并支持一键写入飞书多维表格,解决短视频创作从0到1的难题。 技术 › Skill ✍ AI求道者Siri🕐 2026-07-30 剧本创作IP二创分镜表开源飞书AI技能短视频自动化创意生成
如 如何构建你的第一个智能体工厂 文章探讨了如何从构建单个智能体转向构建智能体工厂,以解决人工审核瓶颈问题。介绍了Sage决策模型在自动化质量控制和输出门控中的应用,提供了具体的实现思路和GitHub资源。 技术 › Agent ✍ Avid🕐 2026-07-30 智能体工厂AI自动化质量控制Sage模型LLM
一 一个月花几十刀在AI生图上今天发现一个开源项目能无限白嫖 介绍了一个名为ParrotAI的开源项目,它是一个本地运行的网页应用,通过自动操控浏览器访问公开免费AI生图网站,实现无限次数的免费生图。无需API key、GPU或注册,生成的图片会自动保存为PNG格式。 技术 › 工具与效率 ✍ Mulight 沐光🕐 2026-07-29 AI生图开源免费工具ParrotAI自动化浏览器操控
C CAG:缓存增强生成,RAG的替代方案 文章介绍了缓存增强生成(CAG)作为一种替代经典RAG流水线的新方案。CAG通过将全部知识预加载到模型上下文并缓存KV Cache,显著提升响应速度,解决检索延迟和召回缺失问题。适用于中短篇幅静态文档,但对大规模或频繁变动数据仍需传统RAG或混合架构。 技术 › LLM ✍ Amto🕐 2026-07-29 CAGRAG缓存增强生成LLM私有知识向量化KV Cache开源