📚 Wiki 知识库

全部文档

1 篇
清除

递归智能体推理性能测试:DSPy 与 Daytona 的 100 任务实证研究

文章介绍了 Fleet-RLM(基于 DSPy ReAct 智能体与 Daytona 沙箱)在 100 个长程推理任务中的表现。实验对比了递归执行与直接 LLM 推理,结果显示递归执行将准确率从 13% 提升至 33%,并完全消除了任务失败。文章详细分析了逻辑、CS、棋类、数学和化学等不同领域的性能差异,揭示了递归架构在工具调用和错误恢复上的优势。

技术Agent ✍ Zachary BENSALEM🕐 2026-05-0414.9 KB