📚 Wiki 知识库

🏷️ RLM

2 篇

探索 GEPA:基于反思的 LLM 上下文提示优化技术

本文探讨了 GEPA (Genetic-Pareto) 技术,一种旨在解决大语言模型上下文管理被动性的提示词优化器。与运行时的 RLM 不同,GEPA 在推理前操作,通过自然语言反馈和试错学习来改进提示词。文章分析了 GEPA 如何利用 Pareto 前沿保持提示多样性,避免单一最优解,并在多项任务中以更少的 rollout 取得优于 GRPO 和 MIPROv2 的性能。作者提出 GEPA 与 RLM 相结合,代表了从单纯增加上下文长度向主动选择和管理上下文的技术范式转变。

技术Agent ✍ Quarq🕐 2026-04-28

RLMs are the new reasoning models

本文探讨了递归语言模型作为一种新的推理范式的重要性。RLM 通过将模型自己的提示视为可检查、切片和递归查询的环境,直接结合了推理和工具使用。文章回顾了推理和工具使用的历史发展,从思维链到 ReAct,再到 OpenAI o1 和 Claude 的工具使用。最新研究显示,RLM 在长上下文、记忆和长推理任务中表现出色,克服了传统单次前向传播的局限。

技术LLM ✍ Raymond Weitekamp🕐 2026-04-21