递归智能体推理性能测试:DSPy 与 Daytona 的 100 任务实证研究
文章介绍了 Fleet-RLM(基于 DSPy ReAct 智能体与 Daytona 沙箱)在 100 个长程推理任务中的表现。实验对比了递归执行与直接 LLM 推理,结果显示递归执行将准确率从 13% 提升至 33%,并完全消除了任务失败。文章详细分析了逻辑、CS、棋类、数学和化学等不同领域的性能差异,揭示了递归架构在工具调用和错误恢复上的优势。
文章介绍了 Fleet-RLM(基于 DSPy ReAct 智能体与 Daytona 沙箱)在 100 个长程推理任务中的表现。实验对比了递归执行与直接 LLM 推理,结果显示递归执行将准确率从 13% 提升至 33%,并完全消除了任务失败。文章详细分析了逻辑、CS、棋类、数学和化学等不同领域的性能差异,揭示了递归架构在工具调用和错误恢复上的优势。
文章介绍了 Berkeley 团队提出的 GEPA 算法,该算法作为 GRPO 的替代方案,无需更新模型权重或进行 GPU 训练,仅通过优化提示词(Prompt)即可在 HotpotQA 等基准测试中取得更优成绩。GEPA 的核心在于利用 LLM 读取完整的推理轨迹,通过自然语言反思来迭代优化多模块系统中的每个提示词,从而避免了强化学习中将丰富信息压缩为单一标量信号的信息损耗问题。
本文介绍了由 Hermes 创始人开发的 self-evolution 增强版工具,旨在通过工程化闭环自动优化 Agent 的技能提示词、工具描述及代码。文章详细解析了该工具的工作流,包括构建评测集、基于 DSPy 和 GEPA 的优化算法、PR 审核机制等。作者分析了 synthetic、sessiondb 和 golden 三种评测模式的适用场景,指出该项目虽处于早期阶段,但其从历史会话中挖掘数据并进行系统化反馈的思路,为 Agent 的持续迭代提供了极具想象力的方向。