# 读完 Lilian Weng 这篇,我更确信:未来 AI 的壁垒不只在模型
**作者**: Ethan
**日期**: 2026-07-07T05:58:07.000Z
**来源**: [https://x.com/Hello__Ethan/status/2074520448860405858](https://x.com/Hello__Ethan/status/2074520448860405858)
---

很多人还在把“更强 AI”理解成:
参数更多、训练更久、模型更聪明。
但 Lilian Weng 这篇新文《Harness Engineering for Self-Improvement》讲得很清楚:
下一阶段 AI 竞争,未必先发生在权重层,而很可能先发生在 harness 层。
也就是:
不是单纯“模型变强”,
而是包裹模型的那整套运行系统变强。
什么叫 harness?
可以简单理解成:
模型之外、但决定模型实际表现的那一层系统设计。包括:
- 它如何规划任务
- 如何调用工具
- 如何管理上下文
- 如何读写文件
- 如何存储长期状态
- 如何做评测和回溯
- 如何并行子任务
- 如何在失败后恢复、重试、继续
换句话说:
真正决定 agent 上限的,已经不只是 base model,而是 model + harness。
这篇文章里有几个点,我觉得特别值得做 agent、做 coding AI、做自动化研究系统的人反复看。
### 1)harness 不再只是“prompt 外壳”
早期很多人谈 agent,还是停留在:
│ LLM + memory + tools + planning + action
但现在显然不是这个量级了。
Weng 提到,现代 harness engineering 已经更像:
- runtime design
- workflow design
- evaluation design
- permission control
- persistent state management
这句话很关键。
因为它意味着:
agent 已经不是“提示词工程”的延长线,而是“运行时工程”的问题。
也就是说,未来真正拉开差距的,不一定是谁 prompt 写得更花,
而是谁更会设计:
- 循环结构
- 任务分解方式
- 上下文压缩策略
- 文件系统记忆
- 子代理调度
- 评测闭环
- 失败恢复机制
这也是为什么现在很多顶级 coding agent,看起来都越来越像“小型操作系统”或“小型执行平台”。
### 2)文件系统,可能才是长程 agent 最实用的“持久记忆”
文章里我最认同的一个观点是:
长程 agent 不应该把所有历史都塞进 context。
因为现实任务一旦拉长,产物会爆炸增长:
- 实验日志
- 代码 diff
- 报错栈
- 中间产物
- 文档笔记
- 失败轨迹
- rollout 历史
这些东西很快就会超出上下文窗口,或者即使能放进去,也会让模型的有效推理质量迅速下降。
所以一个重要设计模式是:
│ 把文件系统当作持久记忆层,而不是把 prompt 当作唯一记忆层。
这点对做 coding agent 的人尤其重要。
因为模型天然已经擅长:
- 读文件
- 写文件
- 编辑文件
- grep / 搜索
- 跑 bash
所以 **“文件作为长期记忆介质”**,不只是工程上方便,
还是最符合当前模型能力分布的选择。
这其实是一个很强的判断:
未来 agent memory 的实用解,不一定先是“更复杂的 memory database”,而可能是“更结构化地使用文件系统”。
### 3)子代理 + 后台任务,不是花哨功能,而是规模化执行的基础
Weng 提到 harness 的另一个关键模式:
sub-agent and backend jobs
这背后的问题很现实:
如果一个主代理要同时探索多个假设、并行实验、尝试不同修复路径、搜索多个方向,
那它不能把一切都串行塞进一个线程里。
否则会遇到几个致命问题:
- 主上下文污染
- 任务状态混乱
- 实验互相覆盖
- 无法恢复中间结果
- 无法稳定汇总并行探索结果
所以更合理的架构是:
- 主代理负责任务控制
- 子代理负责隔离探索
- 后台任务负责长时间运行
- 日志 / 文件 / 状态记录负责可恢复性
这让我觉得,很多人现在讨论“subagents 值不值得做”,其实问题问小了。
真正的问题不是“要不要 subagent”。
而是:
你的 agent 系统能不能把并行性显式化、可观测化、可恢复化。
如果不能,那很多复杂任务注定跑不远。
### 4)真正难的不是“长上下文”,而是“上下文工程”
文章里还提到一个非常关键的方向:
Context Engineering
这几年很多人习惯把问题交给 long context:
│ 窗口再大一点不就好了?
但实际做过 agent 的人都知道,
窗口变大 ≠ agent 自动变聪明。
因为问题不只是“能不能塞进去”,
而是:
- 什么该保留
- 什么该丢掉
- 什么该结构化
- 什么该抽象成规则
- 什么该沉淀成长期记忆
- 什么该在当前回合可见
- 什么该变成外部 artifact
文章里提到的 ACE(Agentic Context Engineering)和 MCE(Meta Context Engineering),本质上都在回答一个问题:
上下文不是一段不断变长的 prompt,而应该是一个可演化的工作手册 / 知识结构。
这点非常重要。
因为如果你把 context 理解成“历史消息拼接器”,
那你做出来的 agent 很容易在任务变长后崩掉。
但如果你把 context 理解成:
- 当前任务视图
- 结构化经验
- 可增量更新的知识条目
- 可迭代演化的执行手册
那么你其实已经不在做“prompt assembly”,
你在做的是:
agent cognition interface design
这比“提示词怎么写”高了一个层级。
### 5)未来被优化的对象,正在不断上移
文章里有个我很喜欢的判断:
│ harness system 中被优化的对象,大致经历了
│ instruction prompts → structured context → workflow → harness code → optimizer code
这意味着什么?
意味着 AI 系统的优化目标,正在从“写一句更好的提示词”,逐步上移到:
- 设计更好的上下文结构
- 设计更好的工作流
- 设计更好的 harness
- 最终设计“优化 harness 的系统”
如果这条路径成立,那很可能会出现这样一个局面:
过去我们优化“答案”,
现在我们优化“得到更好答案的方法”,
再往后,我们优化“持续优化方法的方法”。
这其实就是更现实版本的 recursive self-improvement。
不一定是模型自己改权重。
但完全可能是:
模型帮助改进训练管线、部署系统、harness 机制、上下文工程和自动研究流程,从而让下一代系统整体更强。
这已经足够构成“递归改进”。
### 6)为什么这篇文章对做 coding agent 的人特别重要?
因为 coding agent 是今天最成熟、最接近商业闭环的 harness 场景之一。
Weng 也明确提到,像 Claude Code、Codex 这类系统,已经说明了一件事:
harness 不是可有可无的胶水层,而是产品能力本身。
同一个基础模型,在不同 harness 上跑出来,体验和结果可以差非常多。
差异可能来自:
- 工具定义是否合理
- 文件读写是否高效
- 上下文是否压缩得当
- 权限是否处理得好
- 失败能否恢复
- 评测与自检是否在线
- 子任务是否能并行
- 状态是否可持久化
所以如果你今天在做 agent,
一个越来越重要的问题不是:
│ “我该换哪个模型?”
而是:
│ “我该怎么设计这层 harness,才能让模型真的发挥出来?”
这篇文章本质上就是在把这个问题系统化。
### 7)我自己的最大收获
如果只让我用一句话总结这篇文章:
AI 的下一轮进步,很可能先来自更强的 harness,而不只是更强的模型。
谁更会设计:
- workflow
- context
- memory
- tool use
- evaluation
- persistence
- orchestration
谁就更可能做出真正跑得远、跑得稳、还能持续自我改进的 agent 系统。
这也是为什么我越来越觉得:
未来 agent 工程师,
本质上会越来越像在做:
- runtime design
- operating system design
- compiler / scheduler mindset
- stateful software architecture
而不只是“给 LLM 接几个工具”。
### 8)如果你做这些方向,我强烈建议读原文
适合阅读人群:
- 做 coding agent
- 做 AI IDE
- 做自动化研究系统
- 做 tool-use agents
- 做 multi-agent orchestration
- 做 context engineering
- 做长期任务 AI 系统
- 对 recursive self-improvement / auto-research 感兴趣
原文:
https://lilianweng.github.io/posts/2026-07-04-harness/
> **Lilian Weng@lilianweng**: [原文链接](https://x.com/lilianweng/status/2074372369213428144)
>
> new post on harness engineering for AI self-improvement: https://lilianweng.github.io/posts/2026-07-04-harness/…
> It is hard to forecast how much the future of RSI will rely on harnesses. Likely harness engineering will evolve in the direction of self-improvement and enable auto-research, and, in turn, smarter
## 相关链接
- [Ethan](https://x.com/Hello__Ethan)
- [@Hello__Ethan](https://x.com/Hello__Ethan)
- [1.3K](https://x.com/Hello__Ethan/status/2074520448860405858/analytics)
- [https://lilianweng.github.io/posts/2026-07-04-harness/](https://lilianweng.github.io/posts/2026-07-04-harness/)
- [Jul 7](https://x.com/lilianweng/status/2074372369213428144)
- [534K](https://x.com/lilianweng/status/2074372369213428144/analytics)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [11:46 PM · Jul 7, 2026](https://x.com/Hello__Ethan/status/2074520448860405858)
- [1,389 Views](https://x.com/Hello__Ethan/status/2074520448860405858/analytics)
---
*导出时间: 2026/7/8 15:40:34*