# 怎么用 Fable5 做团队复盘:从几十份内部文档到下周行动清单
**作者**: Kyrie
**日期**: 2026-07-11T04:48:59.000Z
**来源**: [https://x.com/KyrieCheungYep/status/2075804524414194007](https://x.com/KyrieCheungYep/status/2075804524414194007)
---

这几天我分享了许多在用 Fable5 的经历还有方法。
原因很简单,这个被叫做全球最强编程模型的东西,本来说好要下架,后来又延期到 7 月 12 号,也就是明天。基本所有人都在问同一句话:趁下架前这几天,到底能拿它干点什么才不亏。
我看了一圈,大部分人的答案是拿它写个网站、做个小工具、跑几个跑分,过过瘾,或者拿它整理自己的文件。这些当然没错。但我做了另一件效益非常高的事。
那天晚上我把销售团队攒了几个月的东西全翻了出来。每周的周报,一堆会议纪要,几个客户的分析过程,中间产出的乱七八糟的文档、报价草稿、跟进记录。加起来几十份,格式各异,有的是我写的,有的是同事丢在群里的截图转的文字,还有一些是我自己都快忘了当时在想什么的半成品。
我没整理,没删减,也没写什么漂亮的说明。就这么一股脑打包丢给它,然后敲了一句话:你现在是我的军师,把这些全看一遍,告诉我这个团队接下来该往哪走、哪里做错了、具体怎么改。
半小时后它吐回来的东西,比我们开一整个季度的复盘会都清楚。
它指出来的几个问题,有一两个是我隐约感觉到、但一直说不出口的;还有一个是我压根没往那想、被它一句话点破之后凉飕飕的。更意外的是,它给的方向没有停在正确的废话上,已经具体到下周谁去干什么。
那一刻我脑子里冒出来一句话:这些信息一直都在,只是从来没有人这么看过它们。
周报写完就躺在文件夹里吃灰,纪要开完就没人再翻,客户分析做完那一版就定死了。它们各自都是碎的,散在几十个文件里,人的脑子装不下这么多,也没耐心把它们摊在一张桌子上重新拼一遍。但模型可以。
我尽量拆到所有人可以照着抄的程度。但先说清楚,这件事能做成,光靠“模型强”三个字远远不够。同样的操作,方法不对,叫来的可能是一个满嘴漂亮话的复读机,还会顺手把公司最值钱的东西送出去。我踩过一些坑,接下来展开讲讲。
## 一、你要它当什么,让它交出什么
大部分人搞砸的地方,在开口第一句话。
他们习惯这么说:帮我看看这些数据。或者:分析一下这些材料。
这话等于你去餐厅点菜说“随便”。模型会给你一份四平八稳、放之四海皆准、看完等于没看的总结。它不知道你要它扮演谁,不知道你想要什么,只好回一个最安全、最不会出错、也最没用的东西给你。
所以动手之前,有两件事你得先替它定死。
第一件,是角色。
你要它当军师,就明明白白告诉它当军师。你要它当一个刚被请进来、专门给你挑毛病的外部顾问,也照直说。Anthropic 官方的文档里有一句我很认同的话:把模型当成一个聪明、但对你们公司一无所知的新员工。你越是把要求说清楚,它给的东西越准。哪怕只在开头加一句“你现在是一个跟踪政企销售十年的复盘顾问”,它后面的语气、视角、挑毛病的狠劲,都会不一样。
第二件,是交付物。你得告诉它,看完之后要给我什么。
我给的是三样东西,你可以直接拿去用:
一是未来方向。团队接下来三到六个月,重心该往哪压。
二是具体建议。针对现状,哪些动作该加,哪些该停。
三是修改路径。也就是每个建议,落到人、落到本周下周的第一个动作上,是什么。
你注意,这三样里没有“总结”。总结这活你自己会干,用不着它。让它做总结,等于把一个能当参谋的脑子拿去做打字员。
还有一个小动作很关键:让它先诊断,再开方。别一上来就问它“我们该怎么办”。先让它把看到的问题一条条列出来,你过一遍,确认哪些说到点子上了,再让它针对这些问题给方案。顺序反了,它很容易跳过诊断,直接给你一堆通用建议。那些建议对谁都成立,也就对谁都没用。
说到这你可能觉得,让一个模型当团队军师,听着有点玄。我原来也这么想。直到我看到 Anthropic 自己披露的一个数字。乐天(Rakuten)用 Opus 4.6 这一级的模型,在一天之内自主关掉了 13 个待办、把 12 个任务分派给了对的人,管的是一个大约 50 人的组织,横跨 6 个代码仓库。它既做技术判断,也参与产品和组织层面的决策,能跨好几个领域把上下文串起来。最让我在意的是最后一句:它知道什么时候该停下来、把事情上交给人。
一个能判断自己什么时候该闭嘴、该请示的东西,拿来当军师,我觉得够格了。
你可能还是犯嘀咕:出方向、给战略这么吃判断力的事,模型凭什么行?有个做了六年数据战略、当过 CDO 的人写过一段话点醒了我。他说,做战略的人跟艺术家一样,总以为自己在施展什么创造性的魔法。可拆开看,我们干的活儿跟模型很像,都是识别模式、再套用模式。战略工作骨子里有大量模式匹配,它才有了被自动化的空间。他做过一个实验,让模型起草一份数据产品清单,花两天调好一个 prompt。别人拿这个 prompt 几分钟跑出来的结果,跟一家顶级咨询公司做了三个月的项目相比,十条建议里撞了七条。
模型当然顶替不了一个好参谋。它给的东西,顶多相当于初级顾问交上来的第一版草稿。可一版草稿,已经比一张白纸值钱太多了。喂给它最好的燃料,恰恰就是会议纪要和这些内部文档,有人把它叫做新时代的石油。这也顺势带出下一个问题:这些燃料,到底该怎么喂。
## 二、那一坨乱七八糟,到底怎么喂进去
这是最多人问、也最容易做错的一步。
先说我的做法:材料不用精修得漂漂亮亮,但必须有结构。
我拆开说。
先说为什么可以原样扔。今天顶级模型的上下文窗口已经大到离谱。Opus 这一级有 100 万 token 的窗口,几十份周报纪要塞进去绰绰有余。而且它们确实在变强,Anthropic 有个专门测长文里找细节的评测叫 MRCR,8 根针的百万级版本,Opus 4.6 能拿到 76 分,而上一代的 Sonnet 4.5 只有 18.5 分。这个跳跃意味着,把一大堆东西丢进去让它通读,今天确实能跑。
但接下来这段更重要,因为它是大部分人翻车的地方。
窗口大,不等于你可以无脑往里灌。
有一篇我很喜欢的文章,标题直接叫《上下文窗口是个谎言》。里面有句话特别损,也特别对:任何傻子都能把十万 token 一股脑砸进 prompt 里,真正的本事是知道什么时候该分块、什么时候该检索、什么时候该让它先做摘要、什么时候直接告诉它去哪一段看。这是手艺活,跟窗口有多大没关系。
还有一家做工程的公司 HumanLayer 做过实测,很有意思。他们本来很兴奋地把模型换成了 100 万上下文的版本,结果用了两周又换回去了。原因是,上下文一拉长,模型对指令的遵循度明显下降,甚至在窗口没塞满的时候也变差了。它会忽略你给的设计文档,会犯低级错误,有时候干脆违背你的明确要求。他们后来得出一句我记到现在的话:隔离胜过扩张。与其把所有东西塞进一个大窗口让它硬扛,不如把上下文切开、让它每次只聚焦一小块。
把这两头合起来,就是喂料的手艺。原样扔进去省了你精修的功夫,这个便宜可以占;但你得用结构去对冲长上下文带来的走神。

具体怎么做,几个可以照抄的动作:
第一,分类。别把几十个文件铺成一坨。按类型归好,周报是周报,纪要是纪要,客户分析是客户分析。喂的时候用清晰的标题或者标签把每一块框起来。Anthropic 官方的建议是,多份文档就用 XML 标签包,每份外面套一个 document,里面标好 document_content 和 source。你不用搞那么工程化,在每份材料前面加一行“以下是 3 月到 6 月的周报,共 12 份”,效果就已经差很多。
第二,长料放前面,问题放最后。官方文档里有个具体数字:把长文档放在 prompt 顶部、把你的问题放在最末尾,复杂多文档任务的回答质量最高能提升 30%。所以正确的顺序是,先把那一坨材料全贴上去,最后再写你要它干什么。反过来先说要求再贴材料,它读到后面已经把前面的要求忘了一半。
第三,给它一张地图。在所有材料的最前面,用几行字告诉它:材料里有什么、时间跨度多长、团队多少人、你最想解决哪个问题。这张地图不长,却决定了模型会带着问题去读,还是漫无目的地扫。
第四,让它先做笔记,再下结论。官方有个技巧叫 ground in quotes,意思是让模型在分析之前,先把材料里跟你问题相关的原文片段引出来,再基于这些片段作答。这一步能帮它穿过大量噪声,也顺便让你手里多了个东西,能查它到底有没有瞎编,这一点第五节我会重点讲。
好,到这里都是在讲怎么扔得聪明。但有一条红线我必须单独拎出来,因为它比上面所有技巧都硬:脏活它能扛,脏数据它扛不了。
有一篇 DataKitchen 的文章把这件事讲得特别透。他们给了一个简单到吓人的乘法:假设你的数据 80% 是对的,模型本身有 80% 的准确率,那你最后拿到的产出,准确率只有 64%。两层误差会乘在一起。模型不会神奇地帮你修好烂数据,只会把烂数据的影响继续放大。
他们还有一句我抄下来了:LLM 分不出干净数据和损坏数据,它会自信满满地把残缺的、过期的、算错的东西当成完好的来分析。于是你得到一份听起来很前沿、很高级的分析,底下垫的其实是一堆精致的垃圾。
所以喂之前,别的可以乱,但事实层你得保证是真的。金额别写错,客户名别张冠李戴,关键数字别是三个月前的旧版。格式乱它不在乎,数字错它会一本正经地拿去推演,然后给你一个错得非常有说服力的结论。
顺便说一句,有人会问,那我给它补充一堆元数据和说明,能不能救回来?DataKitchen 的说法是,上下文和元数据确实能提升准确率,但作用有限。别指望靠事后补说明去洗白一份本身就错的数据。
## 三、脱敏这道红线
这一节我说得重一点,因为它是唯一一个做错了会真出事的地方。
你想想你刚才扔进去的是什么。整个团队的客户名单,报价,内部对每个客户的真实判断,谁是决策人,哪单快黄了,哪单还有戏。这些东西是一家公司最值钱、也最见不得光的部分。你为了省半小时,把它整包送进了一个第三方的模型里。
它去哪了,你想过吗。
斯坦福今年有一份研究,专门扒了六家头部 AI 公司的隐私政策,包括 Anthropic、OpenAI、谷歌、Meta、微软、亚马逊。结论是,这六家默认都会拿用户的输入去训练模型,有的还无限期留存,有的允许人工去审阅你的对话记录。研究里特别点出一句,你在对话中上传的那个单独文件,同样会被收集。Anthropic 上个月也悄悄改了服务条款,你和 Claude 的对话默认会被用来训练,除非你自己去关。领头做这个研究的学者被问该不该担心隐私,回答就俩字:绝对该。
如果你觉得这只是学者在吓唬人,那看个真实的。2023 年三星半导体部门的工程师,在用 ChatGPT 调试源码的时候,把公司机密顺手贴了进去,泄了。事后三星内部做了个调查,65% 的员工表示对这类工具的安全风险感到担忧。这样的事已经发生过了。
而且现在监管也压上来了。欧盟的 AI 法案,违规最高能罚到 3500 万欧元或者全球营收的 7%,取高的那个。加州从 2026 年 1 月起,也要求企业对用 AI 做重大决策这件事,得让用户能选择退出。
我劝你照样用,只是姿势得对。几个具体的做法:
用企业版,或者走 API,把数据不进训练池这个开关明确关掉。消费级的免费账号,是最不该拿公司核心数据去喂的地方。
能脱敏就脱敏。客户名换成代号,A 公司、B 公司;具体金额抹成量级,比如“七位数的单子”;人名去掉。模型要的是结构和关系。它需要知道“这个大客户的决策人一直没见到”,但没必要知道客户到底叫什么。
心里得有一条线:哪些材料能上云,哪些只能待在本地。这条线你自己划,但一定要有。
说到底,你省下来的那半小时,赔不起泄露出去的那份客户名单。
## 四、把方向、建议、修改路径逼出来的 prompt
前面铺垫了这么多,到这一步才是真正的活。怎么问,决定了它给你军师级的回答,还是给你一段客套。
我把我实际在用的 prompt 放出来,你可以直接改改字段拿去跑。它长,但每一段都有用。
```
你现在是我的团队复盘顾问,长期跟踪 xxx 团队的运营和策略。
你的任务不是写一份好看的总结,要像一个被请进来挑毛病的外部军师那样,
帮我判断这个团队接下来该往哪走、哪里做错了、具体怎么改。
我会在下面依次给你这些材料(已按类型分好):
- 团队周报(时间跨度:X 到 Y,共 N 份)
- 会议纪要(共 N 份)
- 客户分析与跟进记录(涉及 N 个客户,已用代号)
- 其它零散产出(报价草稿、方案片段等)
团队背景(一句话地图):
- 团队规模:X 人
- 主要业务:……
- 我现在最想解决的问题:……
请严格按下面的顺序和要求来做,不要跳步:
第一步:先诊断,别急着给方案。
读完全部材料后,先列出你看到的问题清单,按严重程度排序。
每一条问题,都必须引用材料里的具体出处(哪一份周报、哪次纪要的哪句话),
引不出出处的判断,标注为"推测",不要和有据可查的问题混在一起。
这一步只列问题,先停下来等我确认。
第二步(我确认问题之后再做):针对确认的问题,给出未来方向。
- 团队接下来 3 到 6 个月,重心应该压在哪里,为什么。
- 每个方向后面标注:这是基于事实 / 基于推测 / 需要进一步验证。
第三步:把方向拆成具体建议。
- 哪些动作要加,哪些要停,哪些要改。
- 每条建议对应它解决的是第一步里的哪个问题。
第四步:把每条建议翻译成能落地的修改路径。
每条给出:谁负责、本周或本月的第一个动作是什么、
怎么判断这个动作有没有效、需要改掉团队现在的哪个习惯。
全程要求:
- 宁可保守,别夸大。看不出机会就说看不出,别硬凑漂亮话。
- 每条结论后面标"事实 / 推测 / 待验证",让我一眼能分。
- 哪里信息不足,直接写"信息不足,建议补充 X",不要替我编。
- 用中文,说人话,别用管理黑话和空洞的正确废话。
```
这份 prompt 里藏了几个我从官方文档里学来的东西,顺手拆一下,你就知道为什么这么写。
给角色、把要求说清楚、让它宁可保守别夸大,这些都是 Anthropic 反复强调的基本功。让它每条标注事实还是推测,是逼它对自己的确定性负责,省得把猜的和真的糊成一团喂给你。而分四步、先诊断再开方、中途停下来等你确认,本质上是把一个大问题切成了一条链,每一步你都能看、能改、能打断。官方管这个叫 prompt chaining,最常用的形态就是先出草稿、再检查、再改。
这里我想多说一句。很多人图省事,喜欢一句话把所有要求全砸进去,指望它一次吐一个完整答案。我劝你别。你一次问一坨,它就还你一坨泛泛的东西。把问题切开,一步步逼,它才会给你能用的细节。看着慢,实际更省时间。

## 五、不要让它变成一个满嘴漂亮话的复读机
这一节,是这整套方法里判断力最集中的地方。你前面做得再对,这一步不做,前功尽弃。
先讲一个让我印象很深的研究。哈佛商业评论今年三月发了篇文章,标题很扎心,说研究者去问大语言模型要战略建议,得到的是一堆 trendslop。这个词你可以理解成“潮流废话”。他们的发现是,领导们以为模型能提供一种不带偏见的、外部的视角,但实际上,头部模型在战略问题上有明显的偏见,它会系统性地推荐那些迎合当下管理流行词的策略。
指望它做中立外脑,多少有点天真。它读了全网的管理鸡汤,很容易把最时髦的那几个词再还给你。
国内也有类似的说法。帆软那篇讲企业用大模型的文章里提到一个词,叫假智能。就是 AI 给出的分析看着挺唬人,但业务团队一看就知道是废话,因为它压根没考虑你们的真实流程。
模型给完东西,你的活儿才刚开始。你要像审一个下属的方案那样审它。几个具体动作:
做和检分开。让它出方案的那个对话,别让它自己判分。模型给自己打分的时候普遍手松。你另开一个干净的对话,或者用一个专门的角色,把它的输出贴进去,让它专门挑刺:这些结论里,哪些证据不足,哪些是过度引申,哪些自相矛盾。Anthropic 官方也建议,让模型在回答前先去调查、别对没看过的东西下判断,这句话反过来用,就是你要逼它为每个判断拿出依据。
这一步我也有一段现成的 prompt,新开一个对话,把原始材料和上一步的复盘结论一起贴进去,然后用它:
```
你现在是一个专门找茬的审稿人,立场跟写这份复盘的人是对立的。
你的任务不是补充、不是夸奖,是尽你所能地把下面这份复盘打穿。
下面依次是:原始材料(周报、纪要、客户分析),以及一份基于这些材料写出的团队复盘结论。
请逐条审查复盘里的每个判断和建议,对每一条给出裁定:
- 站得住:能在原始材料里找到明确出处,出处引出来。
- 证据不足:结论有道理,但材料里撑不起这么强的话,指出它引申过头在哪。
- 站不住 / 疑似编造:材料里找不到依据,或者跟材料里的事实矛盾,把矛盾点摆出来。
然后回答两个问题:
1. 这份复盘里,最像"正确的废话"、放到任何一个销售团队都成立的建议,是哪几条?
2. 原始材料里,有没有哪个明显的问题或信号,是这份复盘完全没提到的?
全程默认怀疑,宁可错杀。不许用"整体不错""方向正确"这类和稀泥的话。
```
经得起这么一审的结论,你才敢往下用。我实测过,第一版复盘里总有那么一两条,是它顺着材料的语气自己脑补出来的,审稿这一步专治这个。
逼它给证据。这是最好用的一招。让它的每一条结论,都必须指回你喂进去的原文,是哪一份纪要、哪一句话支撑了这个判断。指得出,说明它是真读了;指不出、开始打太极,那这条基本就是它编的。
让它自己找反例。问它两个问题:这个结论在什么情况下会是错的?我给你的材料里,有没有和这个结论相反的证据?一个诚实的军师会认真回答,一个复读机会开始重复刚才的话。
追问到具体。它说“要加强对重点客户的跟进”,你别放过这句正确的废话。追下去:具体哪几个客户?依据是哪次跟进记录?下一步谁、在什么时候、做哪个动作?追不下去的,就是空的。
我为什么把这节看得这么重。DataKitchen 那篇文章里有个词组我一直记着,叫 false authority,虚假的权威。AI 当然会说错,人也会。麻烦在于,它能把一个编出来的、或者基于残缺数据的结论,说得比你还笃定、还像那么回事。你一不留神就信了。
所以这套逼问,是在保护你自己。
## 六、从一个漂亮的方向,到下周行动
假设你走到这一步了,它给的方向也经受住了你的逼问。还差最后一公里:让这些方向真的能在你们团队里跑起来。
这一步的坑,爱分析有份报告点得很准。他们调研了近百家企业落地大模型,发现项目最大的死因之一,是这个项目跟公司战略对不上。一把手听汇报,问的第一个问题往往就是:这东西跟我们公司的战略有什么关系?如果负责人只会讲技术,讲这模型多能干、多方便,答不上跟战略的关系,这个项目基本就过不了审。
AI 给你的方向,一模一样。它可能给出一个逻辑漂亮、听着高级的方向,但如果这个方向对不上你们真实的盘子、对不上老板今年定的那几个数,它就是一份精美的 PPT,落不了地。
那就让它把每个方向都翻译一遍,翻译成四个问题的答案:
谁负责这件事。别写“团队”,把具体的人写出来。
第一个动作是什么。本周或者本月,先迈哪一步。“制定一个计划”还得继续往下拆;“周三之前把 A 客户的决策人约出来喝杯咖啡”,这才算动作。
怎么知道它有没有用。给一个能观察的信号,一周两周后你能回头看的那种。
要改掉现在的哪个习惯。任何新方向的落地,通常都意味着停掉一个旧动作。这一条最容易被忽略,但往往最关键。
关于 AI 在这件事里到底能占多少,我的看法一直没变。它能帮你把一件模糊、重复、靠经验的活儿,做出一个 70 分的初版。市场怎么看,客户怎么拆,问题在哪,方向往哪,它都能给你一个像样的起点。但剩下那 30 分,靠的是真实的信息、团队的执行、还有你自己拍板。
所以你别把它的输出当圣旨。就当一个很聪明、但完全不了解你们内部人情世故和政治的外部顾问,交上来一份初稿。初稿很有价值,但签字的人得是你。

## 七、几个容易翻车的地方
方法讲完了,最后把坑集中列一下。这几条,每一条我都或多或少踩过。
数据质量。前面说过,再讲一遍,因为它最隐蔽。垃圾进去,出来的是精致的垃圾,而且比普通垃圾更危险,因为它裹着一层高级的外衣。喂之前,至少把事实层过一遍。
上下文的幻觉。别信“全塞进去就行”这种话。材料越多,越要给结构、越要让它聚焦。它在一大堆东西里走神的概率,比你想的高。
还有一个更隐蔽的,我姑且叫它认知投降。当它给你的复盘又快又顺又全,你会慢慢懒得自己想了。这次它替你想了,下次你就直接问它。时间长了,你对自己团队的理解,会悄悄地比它更浅。这件事没有工具能帮你,只能靠你自己警惕:它给的是初稿,思考的主语始终得是你。
隐私合规。第三节整节都在讲,这里只重复一句:别拿公司的命,去换你的省事。
还有成本和频率。用一次其实很便宜,做一份文档分析也就几美分的量级。但便宜不等于你该无脑地天天全量跑。真正烧钱、也真正让你变懒的,是频率。想清楚这件事多久做一次值得,别做成一个每天空转的仪式。
把这些坑合起来,其实就一条闸门:让它做诊断和草稿,你来拍板、担责。这条线一旦模糊,前面所有的方法都会反过来伤你。
## 写在最后
Fable5 会下架。就算这次延到 12 号,它迟早也会被下一个更强的模型取代,价格会变,名字会变,用法也会变。
但我这几天做的这件事,方法不会过期。
把一个团队散在几十个文件里的记忆重新摊开、拼到一起、逼出一个方向来,这件事跟具体用哪个模型没多大关系。今天是 Fable,明天是别的,后天可能连模型这个词都不这么叫了。真正值钱的,是你知道该怎么组织那一坨材料、怎么设问、怎么逼它说实话,再把它的话翻译成下周能动的一步。
我越来越觉得,很多团队从来不缺数据。周报天天写,纪要开完就有,客户分析做了一版又一版。缺的是一个愿意把这些东西全摊在桌上、耐着性子重看一遍的人。这个活儿太累、太反人性,过去没人愿意干。如今可以先让 AI 顶上。
它能当那个把一切重看一遍、还敢当面跟你说哪里不对的军师。
但最后决定往哪走、并且为这个决定负责的,还得是你。
关于作者
Kyrie — 前国内大厂 R&D 工程师,现居曼谷,做中国科技企业出海 BD。持续分享出海一线真实记录、AI 在业务里的实战用法,偶尔也聊聊美股投资和国外生活。
- X:.@KyrieCheungYep
## 相关链接
- [Kyrie](https://x.com/KyrieCheungYep)
- [@KyrieCheungYep](https://x.com/KyrieCheungYep)
- [1.9K](https://x.com/KyrieCheungYep/status/2075804524414194007/analytics)
- [@KyrieCheungYep](https://x.com/@KyrieCheungYep)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [12:48 PM · Jul 11, 2026](https://x.com/KyrieCheungYep/status/2075804524414194007)
- [1,928 Views](https://x.com/KyrieCheungYep/status/2075804524414194007/analytics)
- [View quotes](https://x.com/KyrieCheungYep/status/2075804524414194007/quotes)
---
*导出时间: 2026/7/11 23:28:31*