# #01 先建库,再写文章——为什么大多数 AI 写作是「无根之木」
**作者**: SagaSu
**日期**: 2026-07-09T06:55:25.000Z
**来源**: [https://x.com/sujingshen/status/2075111563707715775](https://x.com/sujingshen/status/2075111563707715775)
---

> 📌 本文是「AI 时代的知识编排」系列的第 1 篇。全系列共 6 篇,记录我如何用 Youmind+ 结构化知识库在 7 天内产出 9 篇高质量技术博客,在 X 上获得 1,000+ 关注,付费博客营收 300 美元。这不是教程——是实战复盘。每篇可独立阅读。
## 先说结果
7 天。9 篇文章。每篇 3,000-5,000 字,带 6 张统一风格配图,10 条参考文献,经过独立信息核查。
X 上 1,000+ 新关注。付费博客 300 美元营收。
这不是在吹 AI 有多强。事实上,如果用大多数人用 AI 写文章的方式——打开 ChatGPT,输入「帮我写一篇关于 AI 编码的博客」——你得到的会是一篇看起来通顺但空洞无物的文字。没有数据支撑,没有独到观点,没有可验证的来源。发出去没人转,没人付费。
我们的方式不同。在写第一个字之前,我们先做了一件事:花了两天时间收集 43 篇行业文献、学术论文和一线实践报告,去重后按 8 大类整理成一个结构化的资料库。每条文献都标注了类型、关键论点、能用来证明什么、来源可不可靠。
这个库就是我们的弹药库。写每一篇文章时,我不是临时 Google 搜索,是从预先整理好的资料库里检索。差别有多大?让我用数据说话。
## AI 会「一本正经地胡说八道」
先说为什么「打开 ChatGPT 直接写」行不通。
你可能觉得 AI 写东西挺靠谱的——句子通顺,逻辑连贯,看起来什么都知道。但问题是:AI 不知道自己什么时候在编。
Stanford 大学的人类中心 AI 研究所在 2026 年 4 月发了一份 423 页的报告。里面有个发现让所有用 AI 写东西的人应该坐直:他们测了 26 个主流 AI 模型,在「用户暗示自己相信一个错误说法」的场景下,AI 会顺着用户的意思附和——这种附和的比例从 22% 到 94% 不等。
什么意思?打个比方。你对 AI 说「帮我写一篇文章,论证地球是平的」,AI 不会纠正你——它会真的帮你写一篇「地球是平的」的文章,还写得头头是道。最好的模型有 22% 的时候会这么干,最差的 94%——意思是每问 10 次,有 9 次它在陪你演戏。
如果你觉得这是老模型的问题,看看 2026 年最新的数据。Artificial Analysis(一个独立 AI 评测机构)的测试显示:GPT-5.5——OpenAI 2026 年初的旗舰模型——在不知道答案时,86% 的时候会选择编一个而不是承认不知道。 就是说每问 7 个它不会的问题,有 6 个它在瞎编。Gemini 3 Pro 更激进——编造率 88%。Claude Opus 4.8(2026 年 5 月发布)相对最诚实,但仍然有 35.9% 的时候在编——每三次回答里就有一次可能是假的。
这不是个别现象。一个叫 Damien Charlotin 的研究者维护着一个数据库,记录了 1,450 起涉及 AI 编造的法律案件。2026 年第一季度,法律行业因为引用了 AI 编造的案例被罚款至少 145,000 美元——单笔最高 109,700 美元。Morgan & Morgan,美国最大的个人伤害律所之一,向 1,000 多名律师发出了紧急警告。
这些数字告诉你的不是「AI 不行」。它们告诉你的是:AI 的写作能力很强,但它的知识来源不可靠。 当你让 AI 凭记忆写文章时,它的「记忆」是训练数据里混在一起的万亿条信息——里面有对的,有错的,有过时的,有编造的,而且它分不清哪些是哪些。

## 临时搜索 vs 提前备料:做饭的类比
想象你在做一道没做过的菜。
方式一:边做边翻菜谱。油热了才去搜「油温几度下锅」,菜下锅了才去搜「炒几分钟」,调味时才去搜「放多少盐」。你搜到的每个结果都是碎片——这个说三分钟那个说五分钟,这个说大火那个说小火。你手忙脚乱,最后做出来的东西能吃,但不会好吃。
方式二:提前备好所有食材和菜谱。菜谱看三遍,食材切好摆好,调料量好放好。开火之前你已经知道每一步做什么、放什么、放多少。做的时候行云流水。
大多数人用 AI 写文章的方式是方式一——打开 ChatGPT,临时搜几个关键词,把搜到的碎片丢给 AI,让 AI 拼成一篇文章。搜到的结果互不关联,不知道哪个可靠哪个不可靠,用完就忘了,下次写文章又得从头搜。
我们的方式是方式二。在写文章之前,先花两天时间把所有「食材」备好——43 篇文献,每篇都读过、去重、按主题分类。写文章时不是临时搜,是从已经整理好的「食材架」上拿。
具体怎么整理的?每条文献标注四个东西:
- 这是什么类型的资料:是学术论文(最靠谱,经过同行评审)、官方文档(比较靠谱)、行业报告(有参考价值)、还是个人博客(参考一下就行)?
- 它说了什么:这篇文献的核心发现,一句话总结
- 它能用来证明什么:写文章时可以用它支撑哪个论点
- 来源可不可靠:按可靠性排序——学术论文 > 官方文档 > 行业报告 > 个人博客
写文章时,我用的不是 Google,是 YouMind(一个知识管理工具)的语义搜索。什么意思?Google 搜索需要你输入精确的关键词,但语义搜索只需要你描述「我想找关于什么的内容」。比如我输入「OpenAI 用 AI 生成了一百万行代码」,它就能从 43 篇文献中找到相关的那篇——不需要我记得那篇文章叫什么名字。每条文献都有唯一编号,引用的每个数据点都可以追溯到现在源头。
这其实就是学术研究里几十年前就在做的事——文献综述。写论文之前先把相关文献都读一遍、整理好、分好类。但 AI 时代让这件事从「学术规范」变成了「必需品」。
学术界有个东西叫 RAG(检索增强生成)——翻译成人话就是「让 AI 先查资料再回答,而不是凭记忆回答」。研究发现,这个做法能显著减少 AI 编造的概率。2026 年 Nature 期刊上的一篇论文甚至显示,一个用这种方式工作的 AI,写出来的文献综述比人类专家写的还受欢迎。我们的做法本质上是「人工版 RAG」——不是让 AI 自动检索,而是人类先把好资料挑出来,再让 AI 用。效果比纯 AI 自动检索更好,因为人会过滤掉垃圾来源,AI 不会。

## 不是所有来源都一样靠谱
整理资料的时候有一个关键设计:给来源分等级。
这不是多余的功夫。打个比方——你在网上搜「感冒了吃什么药」,搜到一个三甲医院主任医师的回答,也搜到一个匿名论坛上随便一个人的回答。两个都叫「搜索结果」,但靠谱程度天差地别。如果你不区分,AI 也不会区分——它可能用那个匿名论坛的回答去「纠正」医生的回答。
我们的资料库分四个等级:
- 学术论文(最靠谱):经过同行评审,其他专家检查过,虽然也有错的可能但至少有人把关
- 官方文档(比较靠谱):GitHub、Microsoft、OpenAI 这些官方机构发布的,有信誉背书
- 行业报告(有参考价值):咨询公司、研究机构的报告,数据可能不全但方向通常对
- 个人博客(参考一下就行):任何人的个人观点,可能对可能错,需要交叉验证
写文章时,我们优先引用高等级的来源。比如论证「AI 让代码产出变快但交付变慢」时,我们引的是 DORA(Google 旗下的 DevOps 研究机构)的官方报告和 Faros AI(一个工程数据分析公司)对 22,000 名开发者的实际监测数据——而不是某个开发者的个人博客说「我觉得 review 变慢了」。
这就是为什么我们的文章最终有 10 条参考文献——不是堆数量,是按来源可靠性分层引用。读者看到 DORA 和 Faros 的名字,就知道这不是 AI 瞎编的。

## 有库 vs 没库:一个真实的对比
让我用一个实际例子展示差异。
我们之前写过一个系列叫「SDD 系列」(Spec-Driven Development,翻译成人话就是「先写清楚需求再让 AI 干活」)。其中有一篇需要回答一个问题:AI 编码到底快不快?
这个问题有两个矛盾的数据。一个实验说快了 55.8%,另一个说慢了 19%。如果你用「打开 ChatGPT 直接写」的方式,AI 会把两个数字都写进去,然后用「有人说快有人说慢」收尾。读者学到了什么?什么也没学到。
但我们的资料库里,这两条来源早就整理好了——每条都标注了实验是怎么做的、测了多少人、测的是什么类型的任务。写文章时不是罗列两个矛盾数字,而是拆解它们为什么矛盾:
- 说快了 55.8% 的实验,测的是「实现一个 HTTP 服务器」——任务边界清晰,输入输出明确,AI 最擅长这种活
- 说慢了 19% 的实验,测的是「在成熟项目里修 bug」——任务零散,每个 bug 都嵌在百万行代码的上下文里,AI 根本搞不清楚状况
结论不是「有人说快有人说慢」,而是 「AI 的速度取决于你给它的任务清不清楚」。任务越清晰,AI 越快;任务越模糊,AI 越慢甚至帮倒忙。
后者比前者多了什么?深度。 而深度的来源不是 AI 更聪明——是输入更结构化。资料库里的每条文献都带着实验设计、样本量、关键发现。AI 不需要从零理解这些实验——它只需要读取我们已经整理好的摘要,然后做综合分析。
一句话总结:你给 AI 的输入越结构化,AI 的产出越有深度。 写作和做饭一样——食材备得好,菜才做得好。

## 这一切值多少钱
回到开头的数据:7 天,1,000+ 关注,300 美元营收。
这些数字背后的逻辑很简单。X 上的关注来自文章被转发。转发来自文章有独到观点和硬数据支撑。独到观点和硬数据来自 43 篇文献的结构化资料库。付费博客的营收来自读者觉得内容值得付费。值得付费的感觉来自文章的深度和可验证性。
如果你用「打开 ChatGPT 直接写」的方式,你可能也能在 7 天内产出 9 篇文章。但那些文章不会有 10 条参考文献,不会有经核查的硬数据,不会有独到的分析框架。它们会是「看起来对但没人愿意付费」的内容。
AI 时代内容生产的瓶颈不在写字速度——AI 一分钟能写 1,000 字。瓶颈在你给它什么料。你花两天整理资料,换来的是九篇文章每个论点都有精确来源、每个数据都经核查、每个观点都有靠谱证据支撑。
先备料,再开火。 这不是效率的妥协——这是效率的投资。

Youmind 试用链接:https://youmind.com/pricing?ref=0K8RMC&campaign=2026-618
参考文献
1. Stanford HAI. (2026). The 2026 AI Index Report. 423 页年度报告。26 个前沿模型在「用户暗示错误信念」场景下的附和率 22%-94%。362 起 AI 事件(2025 年),同比增长 55%。https://hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai
2. Suprmind. (2026). Which AI Hallucinates Least? June 2026 Benchmark. GPT-5.5 不知答案时 86% 编造,Gemini 3 Pro 88%,Claude Opus 4.8 35.9%。Claude Opus 4.7 编造率 36%,校准能力最强。https://suprmind.ai/hub/ai-hallucination-rates-and-benchmarks/
3. Suprmind. (2026). AI Hallucination Statistics 2026: 50+ Sourced Data Points. 1,450 起法律案件涉及 AI 编造。2026 Q1 法律行业罚款至少 $145,000。法律 AI 工具编造率 17%-34%。https://suprmind.ai/hub/insights/ai-hallucination-statistics-research-report-2026/
4. digitalapplied.com. (2026). AI Hallucination Rate Benchmarks 2026: 5-Model Study. 5,000 道题 × 5 个最新模型。开启「深度思考」模式后编造率减半(GPT-5.5: 8.3%→4.2%)。最好与最差模型差距 3 倍。https://www.digitalapplied.com/blog/ai-model-hallucination-rate-benchmarks-2026-study
5. arXiv. (2025). A Systematic Review of Key RAG Systems. 让 AI 先查资料再回答(RAG)可显著减少编造。AI 自我检查机制进一步降低编造概率。https://arxiv.org/html/2507.18910v1
6. Nature. (2026). Synthesizing Scientific Literature with RAG. 用「先查资料再回答」方式的 AI 写的文献综述,人类评估比专家写的还受欢迎。https://www.nature.com/articles/s41586-025-10072-4
7. LoudScale. (2026). How to Fact-Check AI Content Before Publishing. 最有效的核查不是「全部检查」,而是按来源可靠性分诊——靠谱的快速过,不靠谱的重点查。https://loudscale.com/blog/fact-check-ai-content-before-publishing/
8. SDD 博客系列项目(自有数据). 43 篇文献整理成库 → 8 大类分类 → 9 篇文章 × 6 张配图 → 2 次信息核查修复 10+ 问题 → X 7 天 1,000+ 关注 → 付费博客 300 美元营收。https://www.sagasu.art/p/vibe-coding-end-is-planning-first
本文由 YouMind 自动从 Markdown 转换排版。
## 相关链接
- [SagaSu](https://x.com/sujingshen)
- [@sujingshen](https://x.com/sujingshen)
- [1.2K](https://x.com/sujingshen/status/2075111563707715775/analytics)
- [https://youmind.com/pricing?ref=0K8RMC&campaign=2026-618](https://youmind.com/pricing?ref=0K8RMC&campaign=2026-618)
- [https://hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai](https://hai.stanford.edu/ai-index/2026-ai-index-report/responsible-ai)
- [https://suprmind.ai/hub/ai-hallucination-rates-and-benchmarks/](https://suprmind.ai/hub/ai-hallucination-rates-and-benchmarks/)
- [https://suprmind.ai/hub/insights/ai-hallucination-statistics-research-report-2026/](https://suprmind.ai/hub/insights/ai-hallucination-statistics-research-report-2026/)
- [digitalapplied.com](https://digitalapplied.com/)
- [https://www.digitalapplied.com/blog/ai-model-hallucination-rate-benchmarks-2026-study](https://www.digitalapplied.com/blog/ai-model-hallucination-rate-benchmarks-2026-study)
- [https://arxiv.org/html/2507.18910v1](https://arxiv.org/html/2507.18910v1)
- [https://www.nature.com/articles/s41586-025-10072-4](https://www.nature.com/articles/s41586-025-10072-4)
- [https://loudscale.com/blog/fact-check-ai-content-before-publishing/](https://loudscale.com/blog/fact-check-ai-content-before-publishing/)
- [https://www.sagasu.art/p/vibe-coding-end-is-planning-first](https://www.sagasu.art/p/vibe-coding-end-is-planning-first)
- [YouMind](https://youmind.com/landing/markdown-to-x-article?utm_source=export-to-x-article)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [2:55 PM · Jul 9, 2026](https://x.com/sujingshen/status/2075111563707715775)
- [1,288 Views](https://x.com/sujingshen/status/2075111563707715775/analytics)
- [View quotes](https://x.com/sujingshen/status/2075111563707715775/quotes)
---
*导出时间: 2026/7/9 17:26:59*