# 一篇文章讲清楚,小白如何从0到1搭建自己的AI知识库(内附提示词)
**作者**: 金尘马
**日期**: 2026-07-29T15:57:44.000Z
**来源**: [https://x.com/jinchenma_ai/status/2082495802640080899](https://x.com/jinchenma_ai/status/2082495802640080899)
---

朋友们大家好啊,我是金尘马。
相信很多人都已经开始用 AI 工具了。豆包、DeepSeek、ChatGPT,手机里至少装了一个。
但好多人可能体感上还是觉得 AI 不够好用。
自己资料散落在不同地方:文章在收藏夹里,文件在网盘里,想法留在聊天记录里,笔记又放在不同的软件里。
每次需要 AI 帮忙,都要重新上传资料、重新解释背景。好不容易聊出一个不错的结果,它又只能留在对话框里。下次遇到相似的问题,还是要从头开始。
这时候,就需要搭一个数据掌握在自己手里的 AI 知识库了。
那这个知识库到底要怎么搭呢?需要用哪些 AI 工具,资料该怎么整理,需不需要懂技术呢?
过去几个月,我一直在搭建和使用自己的 AI 知识库。这个过程并不难,我今天就来给大家分享一下我的搭建思路。
一个存放文本文件的开放文件夹,一个可以操控这些文件的 Agent 工具,一份清楚的工作规则,再加上一个真实任务场景,就可以启动自己的 AI 知识库了。
# AI 知识库,搭的到底是什么?
大家多少都会用到各种软件来管理自己的信息。
有人用 Obsidian,有人用其他笔记软件,也有人直接把文档上传到聊天窗口。
这些方式其实不分好坏,但它们都只是整套工作方式中的一部分。
更准确地说,AI 知识库是一套由文本文件、阅读软件、Agent、规则和真实任务组成的工作方式。
文本文件负责保存资料和知识。Obsidian 或其他支持 Markdown 的软件,方便人去阅读、检查和修改。WorkBuddy、Codex 这一类 Agent 工具,在获得文件权限以后,可以读取、整理、查询和更新这些内容。
规则相当于给 Agent 的工作说明。它要知道去哪里找资料,哪些文件只能读,整理后的内容放在哪里,回答问题时怎样标明来源。
最后还需要一个真实任务来验证知识库是否真的好用。
这个任务可以是写文章,可以是整理某个学习主题,也可以是复盘一个项目。没有实际用途,文件夹整理得再漂亮,也只是换了一个地方存资料。
这套思路可以参考 Andrej Karpathy 分享的 LLM Wiki。
他把个人知识库分成了三类内容。第一类是保留不动的原始资料,第二类是 AI 整理和维护的知识页面,第三类是告诉 Agent 怎样工作的规则文件。
这个思路最值得参考的地方在于,每次加入资料、提出问题和得到答案,都可以继续更新知识库。长期留下来的不只是一次聊天结果,而是一套能够继续使用的知识体系。

# 搭建个人知识库,只需要准备四样东西
## 第一,一个开放的文本文件夹
开放,指资料以普通文件的形式存放。人可以直接打开,获得权限的工具也可以读取,内容不依赖某一款软件。
文本格式可以用 TXT,也可以用 Markdown。
如果手上已经有很多 TXT 文件,不必为了搭知识库先全部转换。
不过我更推荐 Markdown。
Markdown 本身也是普通文本,但它可以用标题区分层级,用列表整理要点,用链接连接不同页面。人阅读的时候更清楚,Agent 处理时也更容易识别文章结构。
更重要的是,Markdown 不依赖某一款笔记软件。今天可以用 Obsidian 打开,以后换成其他支持 Markdown 的软件,底层文件还在。
它不会自动把资料变成知识,但它是一个足够稳定、足够开放的载体。
## 第二,一个真实任务和一小批相关资料
知识库要先服务一个明确的任务,再放入与它直接相关的资料。一开始,不需要把全部的资料都无脑灌进来。
如果准备做写作知识库,可以先放自己的旧文章、选题笔记和研究材料。如果准备整理一个项目,就先放项目文档、会议记录和复盘。
资料先从非敏感内容开始。身份证件、私人聊天、客户机密和其他高风险材料,先不需要导入。
## 第三,一个能够操控文件的 Agent 工具
有了文件,还要让 AI 真正进入这个文件夹工作。
可以从 WorkBuddy、Codex 等 Agent 工具里选择,这类工具的特点,就是看它能不能读取指定文件夹,能不能按照规则整理和更新文件,修改之前能不能让人检查和确认。
Obsidian 在这里承担的是阅读和检查。Agent 工具负责干活,阅读软件负责让人看见结果。
## 第四,一份清楚的工作规则
Agent 能看到文件,不代表它自然就知道应该怎样维护知识库。
第一版先把必要边界写进一个 Markdown 文件,至少说清楚下面几件事。
1. 原始资料只读取,不覆盖。 2. 整理出的知识页面保存到指定位置。 3. 回答问题时标明使用了哪些来源。 4. 找不到或者资料不足时明确说明,不自行补全。 5. 遇到删除、覆盖和拿不准的内容,先询问再处理。
规则的作用,是把一个通用的 AI 工具变成知道边界的知识库助手。
以后出现新的问题,再把对应规则补进去。完整的分类和规则体系可以根据实际使用逐步完善。
# 从0到1,用五个动作跑通
## 第一步,选择一个真实任务
先回答一个问题,这套知识库最近准备拿来做什么?
写作、学习和项目复盘,选一个就够了。
真实任务会反过来决定资料应该放什么、Agent 需要怎样整理、最后要输出什么。没有任务,分类很容易越做越多,最后却不知道怎么用。

## 第二步,建立最小文件结构
在知识库文件夹里,先分出原始资料和知识页面,再放入一份规则文件。
原始资料保存事实依据。知识页面保存 AI 整理后的摘要、主题、比较和阶段性结论。规则文件负责告诉 Agent 怎样读取和更新它们。
名字不需要照搬别人的模板,只要自己和 Agent 都能看懂就行。
## 一段可以直接复制的知识库架构提示词
如果不想自己从头设计目录和规则,可以把下面这段提示词交给 WorkBuddy、Codex 或其他能够读取文件的 Agent 工具。先把方括号里的内容换成自己的实际情况。
```
我想搭建一个个人 AI 知识库,请根据下面的信息,帮我设计第一版的知识库架构规范。
使用场景:[写作 / 学习 / 项目复盘 / 其他]
现有资料:[简单说明资料类型和大致数量]
常见任务:[希望 AI 帮我完成的事情]
请按下面的要求设计:
1. 架构只保留第一版真正需要的内容,至少区分原始资料、知识页面和规则文件,不要一开始加入复杂分类。
2. 说明每个目录和文件分别放什么、由谁维护,以及 Agent 是否可以修改。
3. 原始资料默认只读,不删除、不覆盖。AI 整理出的内容保存为新的 Markdown 文件。
4. 知识页面需要保留来源。资料不足或存在冲突时,明确标注,不自行补全。
5. 修改、移动或删除文件以前,先列出计划,等我确认以后再执行。
最后请输出:
1. 推荐的最小目录结构。
2. 每个目录和文件的用途。
3. 一份可以直接保存为规则文件的内容。
4. 第一个适合用来测试知识库的任务。
先只输出方案,不要直接创建或修改文件。
```
拿到方案以后,先看看目录是否符合自己的使用习惯,再让 Agent 创建文件。第一版不需要设计得很完整,只要自己知道资料放在哪里,Agent 也知道哪些内容能读、哪些内容能改,就可以继续往下走。
## 第三步,使用 Agent 工具读取知识库
把这个文件夹交给 WorkBuddy、Codex 或自己正在使用的 Agent 工具。
刚开始只开放当前知识库目录,不要直接给整个电脑的权限。第一次先让它查看目录和文件,说明现在有哪些资料、可能分成哪些主题、哪些内容存在权限或来源风险。
这一步的目标只是确认 Agent 能正确读取,不急着改文件。
读取失败时,先检查文件夹位置和授权范围,不需要马上研究更复杂的知识库技术。
## 第四步,给它第一项具体工作
不要只说「帮我整理一下」。
把任务说具体一点。先让 Agent 读取指定资料,不修改原文件。
围绕一个明确问题整理内容,在结论旁保留来源,并把结果保存成新的 Markdown 页面。涉及删除和覆盖时,先征求确认。
比如做写作知识库,可以让它从现有文章中整理某个主题下已经表达过的观点,再找出可以继续写的角度。
这样得到的不只是一次回答,而是一份以后还能继续更新的知识页面。
## 第五步,把有价值的结果写回去
很多人使用 AI 的结果没有积累下来,就是因为聊完即止。
一份有长期价值的回答,应该保存回知识库。下次再提出相关问题时,Agent 先查已有页面,再结合新资料更新,而不是重新生成一份彼此无关的答案。
做到这里,第一版就算初步跑通了。
Agent 能根据已有资料回答一个真实问题,并返回来源。结果可以在 Obsidian 或其他软件里重新打开,下次还能继续使用。
如果每次依然从头回答,就检查规则里有没有要求先读取旧页面、再把结果写回。如果担心误改,就把原始资料设为只读,缩小授权范围,修改前先预览。

# 第一版搭完以后,知识库怎么慢慢迭代
接下来最有价值的动作,是让它持续参与真实工作。资料进来以后让 Agent 整理,遇到问题时先查知识库,有价值的结论再写回去。
用得多了,问题自然会出现。
文件变多以后不好找,可以统一文件名,增加目录和索引页。需要在不同主题之间来回查找时,再给页面增加链接。
如果 Agent 反复创建相似内容,就把查重写进规则。重要结论经常找不到原始出处,就要求每次整理都保留来源。
我目前的知识库也是在实际使用中一步步完善的。
随着场景增加,我又慢慢补上人物、项目等页面分类,以及来源和派生关系。资料变多以后,又增加了权限、查重和写后检查。
这些结构解决的是知识库扩展以后出现的具体问题,第一版不必完整复制。
当目录、文件名、索引和链接已经不够用,持续出现漏找、误找,或者需要从大量资料里寻找语义相关内容时,可以继续了解 RAG、向量检索等方案。
这些是更进阶的检索方案。第一版先把目录和规则理清,再用 Agent 跑一个真实任务。以后遇到具体问题,再增加对应的规则和能力。
# 写在最后
回过头看,个人 AI 知识库的第一版,重点是把最小流程跑通。
选一个真实场景,挑一小批非敏感资料,建立一个开放的文本文件夹,优先使用 Markdown,再用 Agent 工具完成一次读取、整理、查询和写回。
工具以后可能会换。
但那些能够直接打开的文件、逐步完善的规则,以及不断积累下来的知识,仍然属于自己。
如果准备开始搭自己的第一版,可以在评论区告诉我,最想先做写作、学习,还是项目知识库?
金尘马|大厂程序员|30天X破万粉变现过万|持续分享 AI 搞钱、程序员转型、OPC 心得|联系方式见主页介绍:https://x.com/jinchenma_ai
## 相关链接
- [金尘马](https://x.com/jinchenma_ai)
- [@jinchenma_ai](https://x.com/jinchenma_ai)
- [2.5K](https://x.com/jinchenma_ai/status/2082495802640080899/analytics)
- [LLM Wiki](https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f)
- [https://x.com/jinchenma_ai](https://x.com/jinchenma_ai)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [11:57 PM · Jul 29, 2026](https://x.com/jinchenma_ai/status/2082495802640080899)
- [2,513 Views](https://x.com/jinchenma_ai/status/2082495802640080899/analytics)
- [View quotes](https://x.com/jinchenma_ai/status/2082495802640080899/quotes)
---
*导出时间: 2026/7/30 10:02:14*