📚 Wiki 知识库

🏷️ 评估

4 篇

AI 开始优化 AI 自己的生产线了:Superpowers 6

本文通过 Superpowers 6 的案例,指出 AI 已突破代码生成,开始具备流程优化与管理能力。AI 审计并改进了自己的工作流,实现了降本增效。文章强调,在 AI 自动化“判断力”的时代,人类的核心价值已从操作机器转向构建诚实可靠的评估系统,即在幻觉与自我欺骗面前,坚持用 Eval 记分牌揭示真相。

技术LLM ✍ DataDan🕐 2026-07-05

AI 工程评估方法详解:Manual、Code 与 LLM-as-a-judge

文章阐述了 AI 工程闭环中评估环节的重要性,详细介绍了手动评估、基于代码的确定性评估以及 LLM-as-a-judge 三种主要方法。作者建议从手动审查开始建立直觉,逐步定义并自动化具体的失败模式。文章还探讨了基于参考与无参考评估的区别,并强调应结合多种方法,优先使用二值评分以确保评估的清晰性与可靠性。

技术LLM ✍ Lotte🕐 2026-05-20

Designing eval datasets for LLM applications

本文是 Langfuse Academy 系列的一部分,深入探讨了 AI 工程生命周期中的数据集设计。文章解释了数据集如何连接生产监控与开发迭代,详细介绍了数据集项的三个核心字段(输入、期望输出、元数据)及不同的评估模式。此外,文章还分享了构建高质量数据集的最佳实践,包括如何定义范围、确定规模,以及如何从生产 Trace、手工编写和合成数据中起步。

技术LLM ✍ Lotte🕐 2026-05-18

编写 Agent Skills 的 8 个技巧

本文是 Philipp Schmid 关于如何编写高效 AI Agent Skills(技能)的实用指南。文章指出技能虽然灵活但难以掌握,并提出了 8 个核心建议:明确技能定义(能力型 vs 偏好型)、精确描述触发条件、编写指令而非冗长文章、保持内容精简、给予 Agent 适当的自由度而非死板的步骤、定义负向触发条件、通过多轮测试评估效果,以及当模型能力提升时及时淘汰冗余技能。

技术Agent ✍ Philipp Schmid🕐 2026-04-14