📚 Wiki 知识库

🏷️ 优化

7 篇

微软开源 SkillOpt:不动模型,只训练 Prompt

微软开源了 SkillOpt 项目,引入了“训练 Prompt”的新思路。与传统的 Agent Skill 开发不同,SkillOpt 在不改变模型权重的情况下,将神经网络训练方法(如 epoch、验证集)应用于优化 SKILL.md 文本。系统通过执行任务、打分、反思和筛选修改建议,实现技能文档的自动化迭代。论文表明,该方法在多模型环境下均有显著提升,且优化后的技能具备跨模型迁移能力。

技术Agent ✍ sitin🕐 2026-07-13

LLM 优化面试笔记:训练与推理核心技术

这是一份针对 AI 实验室面试准备的笔记,涵盖了高效训练和部署大语言模型(LLM)的核心优化策略。内容主要分为三部分:内存优化(如 Flash Attention、MQA/GQA、激活检查点)、计算优化(序列打包、高效变体 Transformer)以及推理优化(KV 缓存、投机解码、量化技术)。文章旨在总结在大规模模型开发中应对算力和内存瓶颈的关键技术。

技术LLM ✍ Gauri Gupta🕐 2026-05-06

Recursive Agent Optimization Actually Works

文章介绍了 HALO(分层 Agent 循环优化),一种构建递归自改进 Agent 框架的方法论。通过专门的递归语言模型(RLM)分析追踪数据并诊断问题,利用编码 Agent 修复漏洞并重新部署。在 AppWorld 基准测试中,经过 5 个循环优化,场景目标完成率从 73.7% 提升至 89.5%。该实验证明,利用 AI 审视自身追踪数据的“鸟瞰视角”能有效识别幻觉模式、工具调用错误及配置缺陷,为未来的框架设计提供了新的优化范式。

技术Harness Engineering ✍ Amar Singh🕐 2026-05-05

因子图与“世界模型”:统一的感知与规划框架

文章探讨了世界模型与因子图之间的深层联系。作者指出,因子图本质上是基于能量的模型,可用于状态估计和SLAM。通过将世界模型锚定在“现在”,文章提出了STAG框架,该框架利用统一的因子图优化机制,同时处理基于过去数据的感知和基于未来目标的规划,实现了感知与行动的无缝融合。

技术LLM ✍ Frank Dellaert🕐 2026-04-24

看完 Anthropic Academy 13 门课后,我对 openclaw 系统做了 17 个改动

作者基于 Anthropic Academy 的 13 门课程,对 openclaw 系统进行了 17 项深度优化。核心收获包括:采用 Adaptive Thinking 替代固定预算,可降低 30-50% 成本;引入 Think Tool 解决多步推理中的思考缺失;重构 Prompt 工程技巧(如 XML 标签分离、防幻觉指令);以及挖掘 MCP 的高级特性(Sampling、Roots)。文章按 ROI 排序提供了详细的改动清单。

技术Openclaw ✍ xiyu🕐 2026-03-03