📚 Wiki 知识库

🏷️ 自动化测试

14 篇

如何让你的 AI 智能体能力提升 100 倍

文章探讨了如何通过建立完善的评估系统来防止 AI 智能体随着时间推移而性能下降。作者提出了利用文件夹结构和特定提示词记录规则、错误和边界情况的解决方案,将模糊的“感觉”转化为具体的测试用例,从而确保智能体持续高效工作。

技术Agent ✍ Andres🕐 2026-07-24

鲍勃大叔:不看AI代码,只设约束

《Clean Code》作者鲍勃大叔表示,为利用AI生产力,他不阅读AI生成的代码,而是通过设置单元测试、QA流程、代码质量指标等严格约束来确保质量。他提出了由多个Agent组成的流水线实践,强调AI时代核心能力从读代码转向写测试和定指标。

技术Agent ✍ 宝玉🕐 2026-07-24

How Anthropic runs large-scale code migrations with Claude Code

Anthropic 分享了使用 Claude Code 进行大规模代码迁移的经验,包括将 Bun 从 Zig 迁移到 Rust(两周完成百万行代码)以及 Python 到 TypeScript 的迁移。文章介绍了六步迁移流程,强调建立强大的“评判者”系统、制定规则书和依赖映射,并说明 AI 如何通过并行处理和自动化验证改变了代码迁移的可行性。

技术Claude Code ✍ ClaudeDevs🕐 2026-07-22

用 Claude Code 重构百万行代码:官方六步迁移法深度解读

本文深度解读了 Anthropic 官方如何利用 Claude Code 完成百万行代码的大规模迁移。文章介绍了 Bun 从 Zig 迁移到 Rust 及 Python 项目转 TypeScript 的惊人案例,并提炼出包括制定规则、小范围试跑、对抗性审查等在内的“六步迁移法”,为开发者提供了高效的 AI 编程与代码重构实战指南。

技术Claude Code ✍ 程序员鱼皮🕐 2026-07-21

做 AI Agent 一年,90% 的时间都在做表面功夫

作者通过一年的 AI Agent 开发实践,发现 90% 的时间浪费在手动测试上。受芯片“验证不对称”理念启发,作者提出构建可验证的架构:通过前后端分离(ACI)使系统对 AI 友好,并引入“确定性断言”和“LLM 裁判”两级回归测试体系。最终实现了由 Coding Agent 自动运行的闭环开发,将开发者从繁琐的手工验证中解放出来,重塑了 AI 时代的开发效率。

技术Agent ✍ Ando🕐 2026-07-08

Builder's Guide: How to Ship your First Product using AI in 2026

本文是一份面向开发者的 AI 产品构建实战指南。作者指出,仅将 AI 作为自动补全工具在复杂项目中会失效,真正的变革在于构建一套可复用的 'Harness' 系统。文章详细介绍了如何通过 .agent 目录结构(包含 AGENTS.md、SKILLS 等)将任务规格转化为可执行的软件,涵盖从规划、实现到验证的核心循环,并提供了适用于 SaaS、MCP 服务及 iOS 应用的通用工作流模板。

技术Harness Engineering ✍ Avid🕐 2026-05-26

AI 工程评估方法详解:Manual、Code 与 LLM-as-a-judge

文章阐述了 AI 工程闭环中评估环节的重要性,详细介绍了手动评估、基于代码的确定性评估以及 LLM-as-a-judge 三种主要方法。作者建议从手动审查开始建立直觉,逐步定义并自动化具体的失败模式。文章还探讨了基于参考与无参考评估的区别,并强调应结合多种方法,优先使用二值评分以确保评估的清晰性与可靠性。

技术LLM ✍ Lotte🕐 2026-05-20

The AI Agent Complexity Ratchet: Why 90% Test Coverage Is Required

文章探讨了 AI 编程代理(Agent)如何改变软件开发的范式。作者通过 GStack 和 GBrain 两个开源项目的经验,指出 AI 使得同时实现高速度和高质量成为可能。核心在于构建“复杂度棘轮”:即 90% 的测试覆盖率。AI 代理能伴随代码编写测试、文档和评估结果,确保每次迭代都建立在质量底线之上,防止退化,从而实现只能变好不能变坏的“单向运动”开发模式。

技术Agent ✍ Garry Tan🕐 2026-05-12

傻子可懂的 Harness Engineering 入门教程 + 项目实战

本文深入浅出地讲解了 AI 编程领域热门的 Harness Engineering 概念。文章将其定义为围绕 AI 模型搭建的一整套工作环境与流程,对比了提示词工程、上下文工程的演进关系,并详细拆解了上下文架构、执行能力、任务编排、反馈机制和架构护栏五大核心模块。作者结合“万能视频下载总结器”的全栈项目实战,展示了如何利用 Plan Mode、MCP 工具、Browser Use 及文档沉淀等技巧,让 AI 持续、靠谱地完成复杂工程任务。

技术Harness Engineering ✍ 程序员鱼皮🕐 2026-04-27

为什么你的“AI 优先”战略可能大错特错

文章探讨了“AI First”战略的误区,指出单纯引入 AI 工具并不等于 AI 优先。真正的 AI 优先需要基于“AI 是主力构建者”的假设,彻底重构流程、架构和组织,即“软件工程 First”。文章详细介绍了 CREAO 团队如何利用脚手架工程、统一代码库、CI/CD 流水线和自愈反馈循环,实现 99% 代码由 AI 编写且一天部署多次的高效模式,同时也指出了该模式适用的场景与局限性。

技术Harness Engineering ✍ 宝玉, Peter Pang🕐 2026-04-14

GStack 深度拆解:YC CEO 的 AI Agent 工厂

本文深入拆解了 YC CEO Garry Tan 开源的项目 GStack。该项目提出了一种基于多角色的 AI 编程工作流,通过 23 个专用 Agent(如 CEO、工程师、QA、安全官)协同工作,将开发者从“写代码的人”转变为“管团队的人”。文章详细介绍了 GStack 的 Sprint 流程、真实浏览器测试、并行开发能力以及安全护栏机制,展示了其如何通过自动化代码审查、测试和部署,实现个人生产力的极大提升。

技术Agent ✍ Yanhua🕐 2026-04-03

Claude Skill-creator 史诗级升级:评估、基准测试与多代理并行

Anthropic 官方 Skills 生成器 Skill-creator 迎来重大更新,新增四大核心功能:评估系统、基准测试、多代理并行测试及描述调优。此次升级解决了长期以来 Skills 质量“黑盒”的痛点,通过量化测试(如通过率、耗时、Token用量)和自动迭代优化,显著提升了 Skills 的触发准确率和执行效果。

技术Agent ✍ 数字生命卡兹克🕐 2026-03-11