# 被 AI 搜索到,只是入场券
**作者**: 船长老刘|独立开发
**日期**: 2026-04-29T12:22:26.000Z
**来源**: [https://x.com/enzyme_dev/status/2049464324138414147](https://x.com/enzyme_dev/status/2049464324138414147)
---

Ahrefs 分析了 140 万条 ChatGPT prompts,发现一个反直觉的结果:
ChatGPT 检索到的页面,最终只有约 50% 会被真正引用。
也就是说,你的内容被 AI 搜索到,只是入场券。进入最终引用列表,才是第二层竞争。
1998 年,Larry Page 和 Sergey Brin 还在斯坦福。
他们写了一篇论文,叫《The Anatomy of a Large-Scale Hypertextual Web Search Engine》。这篇论文介绍了一个搜索引擎原型:Google。
Google 后来改变了整个互联网。但在最开始,它要解决的问题其实很朴素:
> 网页太多了,怎么判断哪些页面更重要?
PageRank 的核心思路,就是利用网页之间的链接关系,给网页的重要性排序。
二十多年后,类似的问题正在 AI 搜索里重新出现。
只不过这一次,系统要排序的不只是网页,而是引用来源。
这里的”引用来源”,对应英文里的 citation。简单说,就是 ChatGPT 或其他 AI 搜索回答里,最后展示给用户的那些来源链接。
这让我想到一个类比:AI 搜索正在进入自己的 PageRank 时刻。
我不是说 ChatGPT 用了 PageRank 算法——我是说它们面对的是同一类问题。
当网页足够多、噪音足够大、内容质量足够参差不齐时,系统就不能只是“找到内容”。它还必须判断:哪些内容更相关?哪些来源更可信?哪些页面值得被展示?哪些信息可以进入最终答案?
传统搜索时代,这个问题对应的是网页排序。
AI 搜索时代,这个问题变成了引用排序。
模型不只是要决定“我看哪些网页”,还要决定“我愿意把哪些网页作为引用来源展示给用户”。
这两个动作不是一回事。
## 被搜索到,只是入场券
很多人讨论 AI 搜索时,容易把“被检索到”和“被引用”混在一起。
但从 Ahrefs 的研究看,这中间明显存在第二道筛选。
在这项研究里,ChatGPT 检索出的 URL 中,约 49.98% 最终被引用,另有 50.02% 没有被引用。
也就是说,差不多一半页面进入了来源池,但没有进入最终引用列表。
这说明一个重要变化:
> 被 AI 搜索看到,只是入场券。被 AI 引用,才是第二层竞争。
这和传统 SEO 有点像。
过去你希望自己的页面被 Google 抓取、收录、排名。今天你可能还要进一步关心:当 ChatGPT、Gemini、Perplexity 这类 AI 搜索系统生成答案时,它会不会把你的页面放进最终引用列表。
被收录不等于排名靠前。
被检索不等于被引用。
这种分层,其实已经体现在 OpenAI 的爬虫设计里:OAI-SearchBot 面向搜索可见性,GPTBot 面向训练数据。搜索可见性和训练使用,已经是两件事。
OpenAI 自己的 web search API 文档里,也能看到类似区分:sources 和 inline citations 不是同一个东西。前者是模型形成回答时参考过的来源,后者是最终展示给用户的引用。
换成中文,就是:
> 来源池 ≠ 最终引用。
“模型看过你”和“模型给你署名”之间,还有一层选择。
这层选择,就是我说的 AI 时代的 PageRank。
## 为什么必须有 AI 引用排序机制
这层筛选几乎是必然的。
互联网不是一个干净的资料库,而是一个混杂着研究、营销、噪音、过期信息和垃圾内容的巨大候选池。
如果模型把所有检索到的内容都等权处理,答案质量一定会下降。
所以它必须筛选。
这个筛选不一定等同于 Google PageRank,但它解决的是同一类问题:
> 面对大量候选页面,如何判断哪些更相关、更可信、更值得展示?
传统搜索排序会考虑相关性、页面质量、来源权威、新鲜度等多种信号。AI 引用排序也必须在类似维度上做取舍,只是它最终展示的不是“十个蓝色链接”,而是答案里的几个引用来源。
所以,我更愿意把 ChatGPT 的引用来源选择,理解成一种新的内容分发层。
过去内容竞争的核心是:我能不能排在搜索结果前面?
现在多了一层:我能不能进入 AI 生成答案的引用位置?
这会改变内容创作者、媒体、SEO、GEO、企业官网,甚至 SaaS 文档和帮助中心的写法。
## Reddit 现象:被使用,不等于被署名
Ahrefs 研究里还有一个很值得看的现象:Reddit。
Reddit 的数据量很大,但引用率很低。
乍看这像是矛盾的:既然 Reddit 被大量检索,为什么很少被引用?
但我觉得这反而很好理解。
这里要先分清两件事:Google 搜索结果里的 Reddit,和大模型答案里的最终引用,不是一回事。
我在 2026 年 4 月 26 日用两个和《星露谷物语》相关的查询做了截图:
- stardew valley profit
- stardew valley profit calculator
这两张图证明的不是“Reddit 会被大模型最终引用”,而是一个更前置的现象:Reddit 很容易进入搜索结果,也就更容易进入 AI 搜索的候选来源池。


截图里还有一个值得吐槽的细节:Reddit 结果下面关联的帖子,有些来自 2016 年、2017 年。
所以,高可见度不等于新鲜,高排名不等于高质量,更不等于适合作为最终引用。
Reddit 像一个巨大的语料矿山。里面有大量真实用户语言、真实问题、群体共识和一线经验。AI 很可能会用它来理解语境、补充背景、观察大众讨论。
但 Reddit 同时也有大量噪音:玩梗、吐槽、重复问题、低质量回答、情绪化表达,甚至还有不少 AI 生成内容和营销内容。
数据量越大,分母越大;但真正适合拿来署名引用的内容,不可能同步增长。
所以 Reddit 的问题不是“有没有价值”,而是“语料价值”和“引用价值”不是一回事。
这对内容创作者、SEOer、GEOer、企业官网和 SaaS 团队都很重要。
你在社交平台上的观点,可能被 AI 学到,成为它理解某个话题的背景语境。但如果这些观点没有稳定链接、清晰标题、明确结构和可归因结论,它们未必会成为最终引用。
换句话说:
> 被 AI 吸收,不等于被 AI 署名。
这个区别会越来越重要。
## 观点不突出,就很难被机器索引
这里还有一个细节:AI 搜索匹配的可能不只是用户输入的原始问题。
为了生成一个答案,模型可能会先把问题拆成几个中间问题,再去找能回答这些问题的来源。比如用户问“为什么 ChatGPT 会引用某些网页”,模型真正需要处理的可能是:它看过哪些来源、哪些来源更可信、标题和 URL 是否匹配问题、内容是否足够新、是否适合被引用。
所以,内容不是只要覆盖关键词就够了。它还要让模型判断:这篇文章到底回答了哪个问题。
这件事最后会落到写作本身。
标题、URL、结构、结论,过去主要是给人看的。
现在它们也是给机器看的。
如果一篇文章观点很散,一会儿讲海湾局势,一会儿讲中年危机,一会儿讲 AI 搜索,一会儿讲个人成长,读者可能还能靠语感理解你在写一种情绪,但机器很难稳定判断:这篇文章到底回答了什么问题?
它不知道该把你放进哪个主题、哪个查询、哪个引用语境。
这不是说文章不能有文学性,也不是说所有内容都要写成说明书。
而是说,如果你希望自己的内容成为 AI 搜索里的可引用来源,就需要让它具备更清晰的“可索引性”。
也就是:
- 标题能说明问题;
- URL 或页面主题能表达语义;
- 开头能提出判断;
- 正文能围绕判断展开;
- 结尾能留下可引用结论。
Ahrefs 的数据也支持这个方向。它们发现,被引用页面的 title,和用户 prompt / fanout query 的语义相似度更高;自然语言 URL slug 的引用率,也高于不透明 URL。
这不是说标题决定一切。
但标题、URL 和结构至少在告诉模型:我这篇内容到底解决什么问题。
## 新鲜度不是免死金牌
另一个容易被误解的是新鲜度。
很多人会说,AI 搜索喜欢新内容。所以只要更新得快,就更容易被引用。
这句话只对了一半。
新鲜度当然重要,尤其是新闻、产品发布、政策变化、价格变化这类场景。
但新鲜度不是免死金牌。
前面《星露谷物语》的截图其实也能说明这一点:Google 搜索结果里关联的 Reddit 帖子,有些来自 2016 年、2017 年。它们并不新,但依然获得了很高可见度。
Ahrefs 的研究里有一个反直觉发现:ChatGPT 整体上偏好较新的内容,但在同一个检索集合里,被引用页面并不总是最新的。很多最终被引用的页面,反而是相对更成熟、更稳定的内容。
这说明模型不是单纯追新。
它仍然要在相关性、可信度、新鲜度和可归因性之间做权衡。
一个很新的页面,如果没有清楚回答模型的中间问题,也可能被检索到,然后被忽略。
一个稍旧但结构清楚、观点明确、来源可信的页面,反而更容易成为最终引用。
所以内容生产不应该只追热点。
真正重要的是:你能不能把一个判断写成长期可识别、可引用、可复用的知识单元。
## 内容创作者、SEOer 和 GEOer 应该怎么应对
我的判断是,AI 搜索正在奖励一种新的内容形态:可被机器归因的知识单元。
如果 AI 搜索真的在做引用排序,那么内容资产就不能只是“能被读”,还要“能被归因”。
它不是单纯的短观点,也不是松散的资料堆砌,而是能被人读懂、也能被机器识别、索引和引用的内容资产。
这件事不只影响个人创作者,也会影响 SEOer、GEOer、企业官网、SaaS 产品页、帮助中心、行业报告和知识库。
因为 AI 搜索不是只在回答“谁写得有趣”,它还在判断:
- 哪个页面能回答这个中间问题?
- 哪个来源更可信?
- 哪个结论更适合被引用?
- 哪个网页能承担最终答案里的署名责任?
这要求内容至少做到三件事。
第一,表达清楚。标题、开头和结论要能说明:这篇内容回答了什么问题。
第二,结构稳定。链接、专题页、文档和长文要能长期存在,而不是只散落在社交媒体的信息流里。
第三,判断可引用。不要只给情绪和态度,也要给可以被摘走、被复述、被归因的结论。
对个人创作者来说,这意味着不能只在社交媒体上输出零散判断。AI 可能会吸收你的观点,但未必把信用给你。
对企业和 SaaS 来说,这意味着官网、博客、文档和帮助中心不能只是营销页面,而要变成清晰回答用户问题的知识资产。
对 SEOer 和 GEOer 来说,优化目标也在变化:过去是让页面进入搜索排名,现在还要让页面进入 AI 答案的引用位置。
这也是我现在越来越重视素材库、wiki 和长文写作的原因。
短内容适合传播观点。
但长内容、专题页、知识库和结构化文档,更适合建立权威。
因为权威不是靠一句话形成的,而是靠持续稳定的判断系统形成的。
最后要说一个容易被忽视的问题:AI 答案后面挂了引用来源,不等于它就可靠。CJR / Tow Center 的测试显示,200 次引用归因里有 153 次部分或完全错误。引用排序会越来越重要,但它本身仍然不可靠——这两件事同时成立。
## 结尾
未来内容竞争的核心问题,不是”我写得好不好”,而是”机器能不能把这句话归因到我”。
## 参考来源
- Ahrefs: Why ChatGPT Cites One Page Over Another (Study of 1.4M Prompts)
- OpenAI Docs: Web search / sources and citations
- OpenAI Docs: Overview of OpenAI Crawlers
- Stanford InfoLab: The PageRank Citation Ranking
- Search Engine Journal / Google Search Status Dashboard: Google March 2026 Core Update timeline
- CJR / Tow Center: How ChatGPT Search (Mis)represents Publisher Content
## 相关链接
- [船长老刘|独立开发](https://x.com/enzyme_dev)
- [@enzyme_dev](https://x.com/enzyme_dev)
- [Why ChatGPT Cites One Page Over Another (Study of 1.4M Prompts)](https://ahrefs.com/blog/why-chatgpt-cites-pages/)
- [Web search / sources and citations](https://developers.openai.com/api/docs/guides/tools-web-search)
- [Overview of OpenAI Crawlers](https://developers.openai.com/api/docs/bots)
- [The PageRank Citation Ranking](https://ilpubs.stanford.edu/422/)
- [Google March 2026 Core Update timeline](https://www.searchenginejournal.com/google-confirms-march-2026-core-update-is-complete/571459/)
- [How ChatGPT Search (Mis)represents Publisher Content](https://www.cjr.org/tow_center/how-chatgpt-misrepresents-publisher-content.php)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [8:22 PM · Apr 29, 2026](https://x.com/enzyme_dev/status/2049464324138414147)
- [1,061 Views](https://x.com/enzyme_dev/status/2049464324138414147/analytics)
- [View quotes](https://x.com/enzyme_dev/status/2049464324138414147/quotes)
---
*导出时间: 2026/4/29 23:16:48*