# 炸裂,Anthropic 给 Opus 5 删掉了 80% 的系统提示词
**作者**: 码良
**日期**: 2026-07-24T17:45:27.000Z
**来源**: [https://x.com/cxjwin/status/2080750936138625040](https://x.com/cxjwin/status/2080750936138625040)
---

Anthropic 把 Claude Code 的系统提示词删掉了 80% 以上,编码评测没有可测量的损失。
消息来自 Thariq Shihipar(@trq212)——2025 年 7 月加入 Anthropic,现在在 Claude Code 团队,全文用 we 说话,说的是自家产品。
> **Thariq@trq212**: [原文链接](https://x.com/trq212/status/2080710971228918066)
>
> We removed ~80% of the Claude Code system prompt for our newest models, this is what we've learned about writing system prompts, skills and Claude.MDs for them.
顺带一提,上个月那篇《Fable 实战指南:找出你的未知》也是他写的。同一个人,先讲"怎么发现你的未知",再讲"怎么把系统提示词删掉 80%"——这两件事其实是一件事的两面:你越清楚自己要什么,需要提前写死的规则就越少。
上一篇《好 Prompt 是删出来的》我给的结论是:2026 年的 prompt 高手,比的是敢删多少,不是能写多少。当时那还是我从 Fable 5 文档字缝里推出来的判断。
这次官方直接甩了个数字出来:80%。
但请先注意一个容易滑过去的区别——这次删的东西虽然叫"系统提示词",但它属于 context,不属于 prompt。
你在对话框里敲的那句话是 prompt,一次性的,说完就过去了。而 system prompt、CLAUDE.md、skills、memory 是 context,写一次跟着你几百次,你连它什么时候生效都不知道。
prompt 写错了,代价是一次;context 写错了,代价是每一次。
所以这篇聊的不是"怎么写提示词",是你那些常驻文件里,到底躺着多少已经过期的东西。
## 一、你的规则,都在替一个已经不存在的模型防守
官方复盘的方式很朴素:读自己团队用 Claude Code 的对话记录。
结果读出这么个场面——同一次请求里,system prompt 说"该写文档的地方写文档",skill 说"不许加注释",用户又提了第三种要求。三方在同一个上下文里互相打架。
Claude 一般还是能猜出你到底想要什么。但官方的措辞很值得琢磨:Claude 必须先更仔细地想清楚这些重叠冲突的指令,然后才能决定做什么。
这句话翻译成人话是:你写的每一条规则,都在花模型的思考预算。 不是占点 token 那么便宜——冲突的规则要模型先当法官再当工人。
那这些规则当初为什么会写进去?
因为每一条都是某次翻车之后打的补丁。模型删过文件,就加一条"不许删";模型写过一屏没用的注释,就加一条"默认不写注释"。当时都是对的。
问题是,补丁有出生日期,但没人给它标保质期。 模型换了一代又一代,补丁不会自己脱落,它们只会安静地待在 CLAUDE.md 里,替一个早就不存在的失败模式继续防守。
官方原话说得更直接:这些约束曾经是必要的,用来兜住最坏情况;但现在发现,很多可以直接删掉,让模型用上下文和判断力自己决定。
## 二、六条老规矩,官方自己认了是"迷思"
原文列了六组 then / now。我先压成一张表:
其中三条是常识重述,三条是真反直觉。挑硬的讲。
1. 规则 → 判断:从"禁令"改成"锚点"
旧版 Claude Code 系统提示词里,注释这件事是这么写的:
> 默认不写注释。绝不写多段落 docstring 或多行注释块——最多一行。除非用户明确要求,否则不要创建规划、决策、分析类文档。
看起来很负责任。但它对相当一部分场景就是错的:用户可能有自己的文档偏好,特别复杂的代码本来就该配多行说明。官方承认,在老模型上这个 tradeoff 只能认——不这么写,模型的注释会大面积跑偏。
新版只剩一句:
> Write code that reads like the surrounding code: match its comment density, naming, and idiom.
> (写出读起来像周围代码的代码:匹配它的注释密度、命名和惯用法。)
我顺手在自己这次会话里翻了下——跑的就是 Opus 5,system prompt 里逐字就是这一句,旧的那三行禁令没了。这条不是路线图,是已经上线的东西。
这个改法的精髓不在"变短",在参照系换了:
- 禁令是绝对的,写死在文件里,一旦离开写它的那个场景就一定有错的时候;
- 锚点是相对的,"像周围的代码"这个标准,扔进任何一个仓库都成立。
能用锚点表达的规则,就别用禁令。 这一条能省掉你 CLAUDE.md 里的一半篇幅。
2. 例子 → 接口:这条最反直觉
few-shot 是 prompt 工程第一课,"教模型用工具,先给两个例子"更是铁律。
官方现在说:给例子反而把模型约束在了一个特定的探索空间里。
替代方案不是"少给例子",是把意图编码进接口本身。原文举的是 Todo 工具:status 只有 pending / inprogress / completed 三个枚举值——模型看一眼枚举就知道该怎么用;再加一句"同时只保留一个 inprogress",行为约束就定义完了。零个例子。
我的理解是,这是把 prompt engineering 的活儿,还给了 API design。
一个自解释的参数名、一个够窄的 enum、一句字段约束,比三个例子更省 context,也更不会把模型带沟里。以后写工具,第一个该问的问题从"我要不要多给两个例子"变成"这个参数自己说清楚了吗"。
一句提醒:这条的前提是模型足够强。给小模型、给开源模型,例子该给还得给。"删例子"是能力换来的红利,不是普适真理。
3. 全部前置 → 渐进披露:CLAUDE.md 从百科全书变路由表
Claude Code 早期是编码工具,所以系统提示词里塞满了 code review 和验证流程的细节。这些东西不是每次都用得上,但用得上的时候极其关键——于是就常驻了。
现在的做法是:把验证和 code review 拆成独立的 skill,需要时才加载。
而且这套逻辑已经从 skill 扩散到工具本身了——部分工具是 deferred loading,agent 得先用 ToolSearch 搜到完整定义才能用。这样就能挂很多工具,而不占用上下文。
同样能在这次会话里对上号:我手上 Workflow 工具的描述里明写着,MCP 工具的 schema 由 ToolSearch 按需加载。
官方特意点名了一个常见迷思:很多人觉得 CLAUDE.md 要写成"所有可能用到的实践的中央仓库",否则 Claude 找不到。 正确做法是搭一棵能按需加载的文件树。
上下文不是仓库,是缓存。
判断一条信息该不该常驻,问一句就够了:一百次会话里,它能用上几次?低于个位数,就该下沉成 skill。
4—6. 剩下三条,快速过
重复 → 工具描述。 老模型对信息位置敏感(末尾的指令比开头的更容易被听进去),所以同一件事要在系统提示词和工具描述里各说一遍。现在可以只写在工具描述里,谁用谁看。
CLAUDE.md 记忆 → 自动记忆。 过去靠 # 快捷键手动往 CLAUDE.md 里塞,现在 Claude 自动保存跟工作和你本人相关的记忆。
这里补个上一篇的回响:当时我说 Fable 5 文档给了个记忆系统模板——一条经验一个文件、一行摘要、发现错了就删——和我自己整理文章库的手感撞了个正着。现在这套东西已经是默认装配了,这次会话的系统提示词里就带着一整节。从"官方推荐范式"到"出厂自带",中间只隔了一个多月。
简单 spec → 高保真引用。 过去 spec 就是一份 markdown。现在 Claude 能接住复杂得多的引用:一个 HTML artifact、一份详细的测试套件、另一个仓库里的一个函数。官方给了个很硬的判断——一个 HTML mockup 的效果,一般好过一段设计描述,也好过一张截图。
还有 rubric(评分标准):把"什么叫好的 API 设计"写成评分标准,再派 verifier agent 拿着它去验,用来固定你的品味。
我把这条压成一句:能编译的规格,胜过能读的规格。 描述是有损压缩,测试不是。
## 三、原文没说的三件事
前面都是转述。下面是我认为这篇最该被补上的部分。
① 80% 的前提是评测,不是勇气
官方敢删 80%,是因为后面跟着半句:编码评测上没有可测量的损失。
他们有评测集,所以"删了没掉"是能证明的。你没有,删完就只剩体感。
而体感在这件事上特别不可靠——删对了的地方,你恰恰感觉不到。 没出问题不会有人来告诉你"这条删得好",出了问题你多半也归因不到三周前删掉的那行。
这正是我之前写《AI 时代,你为什么要有自己的测试集?》的原因,现在它有了个更具体的用途:评测集不只是用来验模型的,是用来给你"删的权利"的。
"敢删"从来不是勇气问题,是测量问题。
② 不是所有规则都在折旧——三类规则,只有一类该删
官方说 skill 别写得过度约束,"except in highly important areas"(极重要的领域除外),然后就没了。到底哪些算 highly important?没说。
我给个自己的分法:
该删的是拐杖,不是护栏,更不是品味。
模型学会走路了,拐杖就该扔;但护栏跟模型强不强没关系——它防的是那 0.1% 的不可逆后果。品味更是:Claude 再聪明,也不知道你们团队三年前吵了两周才定下来用哪个日志库。
拿这三类去扫一遍你的 CLAUDE.md,大部分人会发现:能力型占了七成,而它们正是最容易过期的那部分。
③ 立场差:他们的删,和你的删,成本不一样
官方有充分动机让你少写约束——约束越少,模型的自主空间越大,能力越能体现,顺便还省了他们自己维护提示词的成本。这不阴谋,是客观的立场差。
更关键的是条件差:他们的删除是在有评测、有灰度、有回滚的前提下做的。 你在自己项目里删,翻车成本自己扛。
所以节奏建议是:一次删一类,删完跑一遍你自己的验收,留 git 记录方便回滚。 别读完一篇文章就把 CLAUDE.md 清空。
## 四、四个问题,扫一遍你的 CLAUDE.md
真要动手,就按这四问逐条过:
1. 这条是在补模型的短板吗? 是 → 进候选删除区(能力型规则)。
2. 一百次会话里能用上几次? 个位数 → 别删,下沉成 skill,用渐进披露。
3. 它和别处打架吗? 打架 → 先合并统一,再谈删——冲突比冗余贵得多。
4. 能改写成"锚点"而不是"禁令"吗? 能 → 改写,不用删。(参考"写出读起来像周围代码的代码"。)
再加一条元问题:这段文字能不能干脆换成代码? 一个测试、一个 mockup、一个可以照着抄的函数——都比一段描述更高保真。
官方说把这些最佳实践做进了 claude doctor,能帮你给 skills 和 CLAUDE.md 瘦身。我实测了一遍,有两个坑要提醒:
第一,别在终端跑 `claude doctor`。 那个是安装体检——版本、平台、自动更新、登录状态,一个字都不提你的上下文。要瘦身得在 Claude Code 会话里敲 /doctor,是两个不同的东西。
第二,这条检查是 2.1.206 加的,changelog 写得很具体:
> Added a /doctor check that proposes trimming checked-in CLAUDE.md files by cutting content Claude could derive from the codebase
> (新增一项 /doctor 检查:建议精简已入库的 CLAUDE.md,删掉那些 Claude 本可以从代码库自行推断的内容。)
这句和本文第四节那条建议是同一件事——"别写文件系统一看就知道的东西",现在被做成了一条自动检查。
但也别指望太多:changelog 里只有 CLAUDE.md,没有 skills。官方那句"rightsize your skills and CLAUDE.md"里的前半截,暂时查不到对应条目。所以现阶段 /doctor 能帮你砍的是仓库里那份 CLAUDE.md,skills 还得自己按前面四问手动过。
## 五、行动清单(按角色)
个人开发者:
- 先扫 CLAUDE.md,把"补模型短板"那一类挑出来,一次删一类;护栏和品味一条不动。
- 把禁令改写成锚点——"不许写多行注释" → "匹配周围代码的注释密度"。
- 写工具先想参数:能用 enum 和字段名说清的,别用例子。
Tech Lead:
- CLAUDE.md 定位改成路由表:只留仓库是干什么的 + 代码里的坑,其余下沉成 skill。别写文件系统一看就知道的东西。
- 团队级评测集必须先有——没有它,"该不该删"在团队里就是嗓门大小之争。
- 规则登记时标类型(能力 / 边界 / 偏好),换代时只重审能力型那一栏。
做 Agent / 产品:
- 系统提示词只承载产品上下文:模型在什么产品里、在干什么。这是自建 harness 最值得花时间的地方。
- 工具多了别硬塞,上 deferred loading + 搜索,让 schema 按需进上下文。
- spec 尽量给可执行物:测试套件、HTML mockup、可参照的函数;实在要给标准,就给 rubric + verifier agent。
## 收口:模型每强一代,你就多一批该扔的东西
上一篇的收口是:与其问"这个模型的 prompt 该怎么写",不如问"这个模型让我能少写点什么"。
这一篇往前推一步——
每强一代,你上下文里就有一批规则从"必需"变成"噪声"。但它们不会自己走,只会安静地待在文件里,继续花模型的思考预算,去防一个已经不存在的失败模式。
Anthropic 删掉了 80% 的系统提示词,然后什么也没发生。这件事真正的信息量不是"提示词可以很短",而是:那 80% 早就该走了,只是一直没人去清。
所以真正值得长期攒的只有三样:一套能证明"删了没掉"的评测,一圈守住不可逆后果的护栏,一堆模型永远猜不到的、属于你的品味。
其余的,都是拐杖。
## 相关链接
- [@cxjwin](https://x.com/cxjwin)
- [608](https://x.com/cxjwin/status/2080750936138625040/analytics)
- [@trq212](https://x.com/@trq212)
- [15h](https://x.com/trq212/status/2080710971228918066)
- [2.1M](https://x.com/trq212/status/2080710971228918066/analytics)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [4:24 AM · Jul 25, 2026](https://x.com/cxjwin/status/2080750936138625040)
- [608 Views](https://x.com/cxjwin/status/2080750936138625040/analytics)
- [View quotes](https://x.com/cxjwin/status/2080750936138625040/quotes)
---
*导出时间: 2026/7/25 17:33:01*