📚 Wiki 知识库

🏷️ 测试

4 篇

我当了一次 AI 老板:让腾讯 Marvis 给电脑启动项开「裁员会」

文章介绍了腾讯新推出的操作系统级 AI 助手 Marvis(马维斯)。作者体验了其独特的“AI 办公室”UI 设计,该设计将不同的 Agent 视为员工,直观展示任务进度。作者测试了让 Computer Agent 分析电脑启动项并进行优化的流程,认为虽然目前存在限制,但其可视化的交互方式降低了 Agent 使用门槛。

技术Agent ✍ Florian.C🕐 2026-05-26

Designing eval datasets for LLM applications

本文是 Langfuse Academy 系列的一部分,深入探讨了 AI 工程生命周期中的数据集设计。文章解释了数据集如何连接生产监控与开发迭代,详细介绍了数据集项的三个核心字段(输入、期望输出、元数据)及不同的评估模式。此外,文章还分享了构建高质量数据集的最佳实践,包括如何定义范围、确定规模,以及如何从生产 Trace、手工编写和合成数据中起步。

技术LLM ✍ Lotte🕐 2026-05-18

我测试了 247 个 Claude Skills 并删掉了 224 个:留下的这 23 个改变了我的工作方式

作者花费 6 周时间实测了 247 个 Claude Skills,基于质量提升、效率节省和上下文开销等标准,最终仅保留了 23 个。文章详细列出了 S 级必装工具(如 frontend-design, superpowers)和 A 级垂直领域工具,并给出了安装顺序建议。

技术工具与效率 ✍ Mnimiy🕐 2026-05-06

如何真正防止 Agent 重复犯错:Skillify 实践指南

本文批评了 LangChain 等框架虽有工具但缺乏工作流,导致 AI Agent 测试困难。作者提出“Skillify”模式:通过构建包含确定性代码和单元测试的 Skill(技能),将潜在的 LLM 推理转化为确定性的工具调用。文章以日历查询和时区计算为例,展示了如何利用“薄框架、厚技能”架构,永久修复 Agent 的重复性错误。

技术Agent ✍ Garry Tan🕐 2026-04-22