文章深入探讨了 AI 如何将“能力”转化为基础设施,彻底改变了传统的规模化模式。互联网解决了分发问题,而 AI 解决了执行和协作的摩擦。这使得“超级个体”或“操作员”能够通过编排系统代替管理员工,以一人之力完成过去需要整个团队才能完成的工作。这种转变标志着从劳动规模向认知规模的过渡,以及组织架构作为竞争护城河的终结。
文章阐述了 AI 工程闭环中评估环节的重要性,详细介绍了手动评估、基于代码的确定性评估以及 LLM-as-a-judge 三种主要方法。作者建议从手动审查开始建立直觉,逐步定义并自动化具体的失败模式。文章还探讨了基于参考与无参考评估的区别,并强调应结合多种方法,优先使用二值评分以确保评估的清晰性与可靠性。
本文是 Langfuse Academy 系列的一部分,深入探讨了 AI 工程生命周期中的数据集设计。文章解释了数据集如何连接生产监控与开发迭代,详细介绍了数据集项的三个核心字段(输入、期望输出、元数据)及不同的评估模式。此外,文章还分享了构建高质量数据集的最佳实践,包括如何定义范围、确定规模,以及如何从生产 Trace、手工编写和合成数据中起步。
本文是 Philipp Schmid 关于如何编写高效 AI Agent Skills(技能)的实用指南。文章指出技能虽然灵活但难以掌握,并提出了 8 个核心建议:明确技能定义(能力型 vs 偏好型)、精确描述触发条件、编写指令而非冗长文章、保持内容精简、给予 Agent 适当的自由度而非死板的步骤、定义负向触发条件、通过多轮测试评估效果,以及当模型能力提升时及时淘汰冗余技能。
本文介绍了Lyft联合创始人Matt Van Horn在不读写代码的情况下,利用Claude Code和Codex构建开源项目并登顶GitHub Trending的九条规则。规则包括快速发布、编写计划、信任Agent、优化使用成本、提供CLI工具、让工具自记笔记等,展示了非程序员如何高效利用AI进行开发。