# Karpathy 的 LLM Wiki:为什么这条推文炸了,以及它真正在说什么
**作者**: 艾略特
**日期**: 2026-04-06T02:35:44.000Z
**来源**: [https://x.com/elliotchen100/status/2040981753490477403](https://x.com/elliotchen100/status/2040981753490477403)
---

Karpathy 4月3日发了一条关于"LLM Knowledge Bases"的推文,1500万浏览,4.8万赞,8.8万收藏。两天后他又 quote 了自己,把想法整理成了一个 GitHub Gist,又拿到了480万浏览。Gist 本身拿了将近 5000 个 Star。
这不是一条普通的技术分享。它击中了一个很多人隐约感觉到但没人说清楚的东西。
下面是我对这个 Gist 的完整拆解,以及我自己的一些想法。

原贴

转发
https://x.com/karpathy/status/2039805659525644595
https://x.com/karpathy/status/2040470801506541998
一、Karpathy 到底在说什么
先把核心论点讲清楚。
现在绝大多数人用 LLM 处理文档的方式是 RAG:你丢一堆文件进去,LLM 每次被问到问题的时候,去里面检索相关的片段,然后生成回答。NotebookLM 是这样,ChatGPT 的文件上传是这样,市面上大部分"知识库"产品都是这样。
Karpathy 说这个模式有一个根本问题:没有积累。
每次提问,LLM 都在从零开始。它得重新找到相关的碎片,重新拼接,重新理解。你上周问过的一个需要综合五篇论文才能回答的问题,下周再问,它又得重来一遍。什么都没有沉淀下来。
他提出的替代方案是:让 LLM 不只是检索,而是主动去构建和维护一个持久的 wiki。
这个 wiki 是一组结构化的 markdown 文件,互相链接,由 LLM 全权维护。每当你添加一个新的资料来源,LLM 不是简单地把它索引了事,而是真的去读,提取关键信息,然后整合进现有的 wiki 里。更新实体页面,修订主题摘要,标记新数据和旧结论之间的矛盾,补充交叉引用。知识被编译一次,然后持续维护,而不是每次查询都重新推导。
用他的原话说:wiki 是一个"persistent, compounding artifact"。
二、架构:三层分离
Gist 里最有意思的部分之一是他提出的三层架构:
第一层:Raw Sources(原始资料)
你收集的所有原始材料。论文、文章、图片、数据文件。这一层是不可变的,LLM 只读不写。这是你的信息源头,你的 ground truth。
这一点很重要。他没有让 LLM 去改原始资料,而是让原始资料和 LLM 的产出彻底分开。这意味着你随时可以回溯、核查,知道某个 wiki 页面的内容到底是从哪来的。
第二层:The Wiki(知识层)
由 LLM 完全拥有和维护的一组 markdown 文件。摘要、实体页面、概念页面、对比分析、总览、综述。你读它,LLM 写它。
这一层是整个系统的核心。它不是原始资料的简单搬运,而是 LLM 在原始资料基础上做了理解、提炼、关联之后的产物。
第三层:The Schema(规则层)
一个配置文件(比如 Claude Code 的 CLAUDE.md 或 Codex 的 AGENTS.md),告诉 LLM 这个 wiki 的结构是什么样的,有哪些约定,在摄入资料、回答问题、维护 wiki 的时候应该遵循什么流程。
这一层是让 LLM 从一个"通用聊天机器人"变成一个"有纪律的 wiki 维护者"的关键。没有这个,LLM 每次都会按自己的理解随意组织信息,结果就是混乱。
这三层分离的思路其实很像软件工程里的关注点分离。数据归数据,逻辑归逻辑,配置归配置。
三、操作模式:不只是问答
Gist 定义了四种核心操作:
Ingest(摄入)
你往 raw 目录里丢一个新资料,然后让 LLM 去处理。LLM 读完之后,跟你讨论要点,写一个摘要页面,更新索引,更新相关的实体和概念页面。一个资料来源可能触及 10-15 个 wiki 页面。
Karpathy 说他更喜欢一次只摄入一个资料,全程参与。他会读 LLM 写的摘要,检查更新,引导 LLM 在哪些方面着重展开。但你也可以一次性批量导入,少参与一些。
这里有个细节很值得注意:他没有追求全自动化。他选择了"人在回路"的方式,不是因为 LLM 做不好,而是因为摄入的过程本身就是学习的过程。你在引导 LLM 的同时,自己也在思考这个资料到底重不重要、跟已有知识有什么关系。
Query(查询)
向 wiki 提问。LLM 搜索相关页面,读取,综合回答。回答可以是 markdown 页面、对比表格、幻灯片(Marp格式)、图表(matplotlib)。
关键洞察:好的回答应该被存回 wiki。你做的一个对比分析、一个关联发现,这些不应该消失在聊天记录里。它们应该成为 wiki 的一部分,让你的探索和 LLM 摄入的资料一样,持续积累。
这一点太重要了。大部分人用 ChatGPT 的痛点就是:聊了半天,关了窗口,什么都没留下。
Lint(健康检查)
定期让 LLM 给 wiki 做体检。找矛盾、找过时的信息、找孤立页面、找被提及但没有独立页面的重要概念、找缺失的交叉引用、找可以通过搜索补上的数据空缺。
这个操作模式非常聪明。它把 wiki 的维护变成了一个持续的、可执行的流程,而不是靠人想起来才去做。LLM 不会忘记更新一个交叉引用,不会觉得"这个太烦了下次再说"。
Indexing & Logging(索引和日志)
两个特殊文件:index.md 是内容索引,列出 wiki 里每个页面的链接和一句话摘要;log.md 是时间线,记录什么时候摄入了什么、做了什么查询、跑了什么 lint。
Karpathy 提到一个有意思的经验:在 wiki 规模不太大的时候(大概100个资料来源、几百个页面),LLM 直接读 index.md 来定位相关页面就够用了,不需要搭 embedding + 向量检索那一套。
这跟很多人的直觉相反。大家一说到"知识库"就想到 RAG pipeline、向量数据库、embedding模型。但如果你的 wiki 组织得好,一个结构化的索引文件可能比花哨的检索系统更有效。
四、为什么这条推文能爆
回过头来看,这条推文的传播力来自哪里?
首先是切中痛点。每个重度 LLM 用户都经历过这种挫败感:跟 AI 聊了很多,但什么都没有留下来。知识散落在无数个对话窗口里,没有积累,没有结构。Karpathy 把这个问题说出来了,还给了一个可操作的解法。
其次是身份背书。Karpathy 不是一个普通的技术博主,他是前 Tesla AI 总监,OpenAI 联合创始人。当他说"我最近在这样做",大家会认真听。而且他的表述方式非常关键:他不是在教你,他是在分享自己的实践。
然后是开放性。他在原帖最后说:"I think there is room here for an incredible new product instead of a hacky collection of scripts"。这句话直接把讨论空间打开了。每个创业者看到都会想"这是不是我该做的产品",每个开发者看到都会想"我能不能自己搞一个"。
最后是他的二次引爆策略。隔两天 quote 自己,引入"idea file"这个新概念,附上一个精心写的 Gist。这不是简单的重复,而是给同一个话题增加了新的维度。第一条是"我在做什么",第二条是"这应该怎么分享"。两条帖子加起来接近2000万浏览。
五、我的看法
从技术实践的角度
Karpathy 的方案有一个很实际的优点:它不依赖任何特定的基础设施。不需要向量数据库,不需要 RAG pipeline,不需要部署服务。就是一堆 markdown 文件 + 一个 LLM agent + Obsidian。任何人都能在半小时内搭起来。
但它也有明显的天花板。
第一,上下文窗口的限制。他自己也说了,目前的规模是大概100篇文章、40万字。LLM 通过读 index 文件来定位相关页面,在这个规模下工作得不错。但如果 wiki 增长到1000个页面、几百万字呢?index 文件本身就会变得太大,LLM 没法一次读完。到那个时候,你还是需要某种检索机制。
第二,一致性问题。LLM 每次更新 wiki 页面的时候,它对整个 wiki 的"理解"取决于它那次对话中读到了哪些页面。如果 wiki 足够大,它不可能每次都读完所有相关页面。这意味着不同时间点的更新之间可能存在不一致,而且这种不一致不容易被发现。Lint 操作可以缓解,但不能根治。
第三,多人协作。他在 Gist 里提到了 Business/team 场景,但目前的方案本质上是单人的。如果多个人(或多个 LLM agent)同时在维护同一个 wiki,冲突怎么处理?谁的理解优先?这不是 git merge 能解决的问题。
从 EverMind Memory 的角度
Karpathy 在手动搭建的这个系统,本质上就是在做一件事:给 AI 造记忆。
他的三层架构,如果翻译成认知科学的语言:raw sources 是感知输入,wiki 是长期记忆,schema 是元认知(知道自己应该怎么记、怎么想)。他的四种操作模式,ingest 是编码,query 是提取,lint 是巩固和修正,logging 是情景记忆。
这不是巧合。他在做的事情,就是人类大脑处理和存储知识的方式。
我们在 EverMind 做 Memory 的时候,思考的是同一个根本问题:AI 不应该是无状态的。每次对话结束就失忆,这不是一个合理的产品形态。AI 应该有能力记住你们之间发生过的一切,理解这些信息之间的关联,并且在未来的交互中利用这些积累。
但 Karpathy 目前的方案是一个 DIY 版本。你需要自己配置 Obsidian,自己写 schema,自己决定什么时候做 ingest、什么时候做 lint。这对于一个技术能力很强的人来说没问题,但对大多数人来说门槛太高了。
Memory 作为产品应该做的事情,是把 Karpathy 描述的这整个 pipeline 变成一个无感的、自动的过程。你不需要手动"摄入",你的每一次对话、每一次分享、每一次标注,AI 都会自动将其编织进你的知识网络。你不需要手动"lint",系统会在后台持续维护知识的一致性和完整性。你不需要自己写 schema,系统应该能从你的使用模式中学习到你关心什么、你的知识是怎么组织的。
换句话说,Karpathy 证明了这个方向是对的。但他证明的方式,恰恰说明了为什么这件事需要变成一个产品,而不是一套脚本。
从行业趋势的角度
这条推文爆火的背后,我觉得反映了一个更大的趋势转变。
过去两年,AI 产品的竞争焦点在生成能力:谁能写出更好的文章,谁能生成更好的代码,谁能画出更好的图。这是一个"单次交互"的竞争维度,比的是每一次调用的输出质量。
但 Karpathy 这条推文指向的,是下一个竞争维度:积累能力。AI 产品的价值不只在于它每次能帮你做什么,更在于它能不能随着时间变得越来越懂你、越来越有用。
这跟搜索引擎到推荐系统的转变很像。早期搜索引擎的竞争是"谁能找到更相关的结果",后来变成了"谁更了解这个用户想要什么"。从无状态到有状态,从通用到个性化。
对 AI 产品来说,同样的转变正在发生。
目前的 ChatGPT、Claude、Gemini,虽然都加了某种"记忆"功能,但基本上还停留在"记住几个用户偏好"的阶段。离 Karpathy 描述的那种"持续编译、持续积累、持续增值"的知识系统还有很大距离。
谁能在这个方向上做出真正好用的产品,谁就拿到了下一阶段的门票。
Karpathy 最后那句"I think there is room here for an incredible new product",我觉得他说得很对。而且这个 product 的形态,大概率不是一个"更好的笔记应用"或者"更好的 RAG 平台"。它应该是一个全新的品类:AI 原生的知识伙伴,一个能跟你一起积累、一起成长的系统。
这也正是我们在 EverMind 试图构建的东西。
六、一个有趣的新概念:Idea File
最后值得单独说的,是 Karpathy 在 quote tweet 里提出的"idea file"这个概念。
他的意思是:在 LLM agent 时代,分享代码和分享想法的边界变了。以前你要分享一个工具,你得写代码、建 repo、写文档。现在你只需要把想法描述清楚,别人的 agent 会根据这个想法去定制一个属于他们自己的实现。
这个 Gist 本身就是这个理念的实践。它不是一个 repo,没有代码,只有一个清楚的思路描述。你把它丢给 Claude Code 或者 Codex,agent 就会帮你把整套系统搭出来。
这个转变如果真的成立,意味着"知识的传播单位"正在从代码变成想法。开源社区的基本单位从 repository 变成 idea file。这对内容创作者来说是一个很大的机会:你不需要会写代码也能分享有价值的技术方案,你只需要把想法描述得足够清楚。
当然,这个概念现在还很早期,能不能真的成为一种新范式还不好说。但至少 Karpathy 用将近5000个 Star 证明了,大家对这种分享方式是有需求的。
ps. 观点是我的,写的过程 AI 帮了不少忙,数据和事实我自己核过。
## 相关链接
- [艾略特](https://x.com/elliotchen100)
- [@elliotchen100](https://x.com/elliotchen100)
- [29K](https://x.com/elliotchen100/status/2040981753490477403/analytics)
- [https://x.com/karpathy/status/2039805659525644595](https://x.com/karpathy/status/2039805659525644595)
- [https://x.com/karpathy/status/2040470801506541998](https://x.com/karpathy/status/2040470801506541998)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [10:35 AM · Apr 6, 2026](https://x.com/elliotchen100/status/2040981753490477403)
- [29.1K Views](https://x.com/elliotchen100/status/2040981753490477403/analytics)
- [View quotes](https://x.com/elliotchen100/status/2040981753490477403/quotes)
---
*导出时间: 2026/4/6 22:02:21*