Agentic 生产级工程实践的 4 个坑
作者基于 Figma 设计稿转代码项目的实战经验,总结了 Agent 开发的四个关键坑点:一是避免让昂贵的大模型做“脏活”,应将固定流程脚本化以节省 Attention;二是 Skill 只是软约束,长上下文会稀释早期指令导致步骤跳过,需拆散流程但会增加上下文传递成本;三是强调可观测性的重要性,缺乏可视化的 Pipeline 盲目跑测试集只会浪费 Token;四是人类不能仅做监督者,需深度思考并跑通流程以引导 AI。
作者基于 Figma 设计稿转代码项目的实战经验,总结了 Agent 开发的四个关键坑点:一是避免让昂贵的大模型做“脏活”,应将固定流程脚本化以节省 Attention;二是 Skill 只是软约束,长上下文会稀释早期指令导致步骤跳过,需拆散流程但会增加上下文传递成本;三是强调可观测性的重要性,缺乏可视化的 Pipeline 盲目跑测试集只会浪费 Token;四是人类不能仅做监督者,需深度思考并跑通流程以引导 AI。
本文介绍了作者针对 AI Agent 提示的 '3 C' 框架:Context(上下文)、Constraints(约束)和 Composition(结构)。与 Chatbot 不同,Agent 需要详尽的上下文而非简短的指令,通过具体的验证步骤(如自检代码、截图确认)作为约束来确保质量,并需要明确的交付格式以引导其思维。文章提供了具体的对比案例和可复用的提示词模板,旨在帮助用户编写高质量的指令简报。
文章详细解读了 Anthropic 发布的 Claude Opus 5 模型及其官方提示指南。核心内容包括“Effort(努力)”设置的使用、从“怎么做”转向“为什么”的提示策略、删除验证指令以降低成本、以及如何控制响应长度和 Agent 叙述行为,旨在帮助用户最大化发挥模型效能。
文章通过三个真实案例,验证了“贵模型编排、便宜模型执行”这一省钱策略。作者发现,虽然便宜模型在文本判定等任务上能打平顶尖模型,但在高复杂度代码和开放式视觉任务上存在局限。关键在于控制模型能力代差和任务可验证性,否则返工成本将抵消节省的 token 费用。
Anthropic 团队将 Claude Code 的系统提示词删减了 80%,但编码评测没有损失。文章指出,许多规则是为老模型打的补丁,已过时。最佳实践转向:用锚点代替禁令,用接口设计代替举例,以及渐进披露。建议开发者清理“拐杖”型规则,保留护栏与品味,用评测集支撑删除决策。
本文深入解析了Claude Code的“harness”架构,解释了为何简单的模型调用不足以构建可靠的代码代理。作者通过CrewAI框架逐步重建了包括核心循环、工具管理、规划机制在内的关键组件,揭示了通过工程化手段弥补模型差距的方法。
本文由作者因遭遇 AI 智能体失控产生高昂费用的经历引出,旨在阐述构建生产级 AI 系统必须掌握的核心概念。文章提出了 AI 系统的通用公式:记忆(RAG)+ 思考(LLM + Tokens)+ 行动(Agents)+ 测量(Evals)。文中重点解析了 Tokens 与上下文窗口的成本与限制、嵌入向量与语义搜索的原理、RAG 检索增强生成的正确姿势、智能体循环中的工具使用与停止条件等关键技术细节,帮助开发者从“调参侠”进阶为真正的 AI 工程师。