
当你在 ChatGPT、Perplexity、豆包里面问一个问题它秒给你答案的时候你有没有想过——这个答案是怎么来的 它从哪获取的信息 为什么它推荐了 A 网站而不是 B 网站 决定排名的因素到底是什么很多人觉得 AI 搜索是个黑箱里面全是魔法没法研究、没法优化。 但其实不是。AI 搜索引擎虽然复杂但它的基本架构和工作流程是有规律可循的。理解了它的工作原理你就知道 GEO生成式引擎优化为什么有用、该怎么优化了。这篇文章我从技术角度拆解一下 AI 搜索引擎的工作流程。 不堆术语用大白话讲清楚。一、AI 搜索引擎 vs 传统搜索引擎根本区别传统搜索引擎Google、百度的工作流程爬虫爬取全网网页建立索引按关键词存储用户输入关键词从索引里找匹配的网页按排名算法排序返回 10 个蓝色链接给用户核心是匹配排序给用户一堆选项让用户自己选。AI 搜索引擎ChatGPT、Perplexity、秘塔搜索等的工作流程爬虫爬取全网内容 模型预训练用户输入问题自然语言AI 理解用户意图AI 从自己的知识库和实时搜索结果中综合信息AI 生成一个完整的答案答案中可能引用了若干来源网站核心是理解生成直接给用户答案而不是给一堆链接。这个区别是 GEO 存在的根本原因。 传统 SEO 是优化匹配和排序GEO 是优化被理解和被引用。 完全是两套逻辑。二、AI 搜索引擎的四层架构我们把 AI 搜索引擎拆成四层来看从下到上依次是Plain Text┌─────────────────────────────────┐ │ 第四层答案生成层 │ ← 用户看到的就是这层的输出 ├─────────────────────────────────┤ │ 第三层信息综合层 │ ← 筛选、排序、综合信息 ├─────────────────────────────────┤ │ 第二层索引存储层 │ ← 存什么、怎么存、存多少 ├─────────────────────────────────┤ │ 第一层数据采集层 │ ← 爬什么、从哪爬、怎么爬 └─────────────────────────────────┘我一层一层讲。三、第一层数据采集层数据采集层解决的问题是AI 的知识从哪来1. 三大数据来源AI 搜索引擎的数据来源主要有三个来源一预训练数据就是训练大模型的时候用的那些数据比如 Common Crawl、维基百科、各种书籍、论文等等。 这些数据是模型天生就知道的知识。 特点是量大、但不是最新的训练截止日期之前的数据。来源二实时爬取AI 搜索引擎会有自己的爬虫实时抓取互联网上的最新内容。 比如 Perplexity 就有自己的爬虫用户问问题的时候它会实时去搜最新的网页。 特点是新鲜、及时但抓取的深度和广度取决于爬虫能力。来源三结构化数据源一些权威的结构化数据比如维基百科的知识图谱、各种数据库、API 数据等等。 特点是准确度高、结构化程度高AI 用起来很方便。2. 爬取策略AI 爬虫跟传统搜索引擎爬虫的爬取策略不一样传统爬虫尽量多爬、越全越好只要是公开的页面都爬下来存着。AI 爬虫更看重内容质量和信息密度优先爬那些质量高、有价值的页面。为什么因为 AI 处理内容的成本比传统索引高得多。 传统索引就是存关键词成本很低 AI 要理解内容、提取信息、建立关联计算成本高很多。 所以它必须有所选择优先爬高质量的内容。这就是为什么我一直强调内容质量比数量重要。AI 爬虫资源有限它会挑内容。你的内容质量高它就愿意爬 质量低它可能连爬都不爬。3. llms.txt 的作用就在这一层llms.txt 就是网站跟 AI 爬虫沟通的协议书。 网站告诉爬虫什么可以爬、什么不能爬、哪些优先爬、爬了能不能用来训练。合规的 AI 爬虫都会遵守 llms.txt 的规则。 所以你配置好了 llms.txt就能在一定程度上引导爬虫的行为。四、第二层索引存储层索引存储层解决的问题是AI 怎么存这些知识存成什么样这一层是 AI 搜索跟传统搜索差异最大的地方。传统搜索引擎的索引倒排索引传统搜索引擎用的是倒排索引—— 一个词对应哪些页面每个页面里这个词出现了多少次、在什么位置。 就像书后面的名词索引查一个词直接翻到对应的页码。优点是快、准、成本低。 缺点是只能做关键词匹配理解不了语义。AI 搜索引擎的索引向量索引 知识图谱AI 搜索引擎用的主要是两种1. 向量索引Vector Index把每一段内容都转换成一个数学向量一组数字。 语义相近的内容向量的距离就近语义不同的内容向量距离就远。用户问问题的时候也把问题转成向量 然后在向量数据库里找距离最近的内容 那些就是语义上最相关的内容。这就是为什么 AI 搜索能理解语义—— 不是它真的懂是它能用向量距离来衡量语义相似度。2. 知识图谱Knowledge Graph知识图谱就是把各种实体人、事、物、概念和它们之间的关系用图的形式存起来。比如北京是一个实体希尔顿酒店是一个实体它们之间的关系是北京有希尔顿酒店希尔顿酒店和五星级之间的关系是属于五星级酒店有了知识图谱AI 就能进行关系推理。 用户问北京有哪些五星级酒店AI 可以直接从知识图谱里找答案 而不是去全文搜索北京 五星级酒店这些关键词。为什么这对你很重要因为你的内容如果能被 AI 轻松地转换成向量、提取出实体和关系 它就能很容易地被存进向量索引和知识图谱里。 存进去了用户问问题的时候才有可能被检索到、被引用。反过来如果你的内容结构混乱、语义不清、实体不明确AI 很难把它转成高质量的向量也很难从中提取出有效的实体关系。 那它可能就不会被存进索引或者存进去了质量也很低排名靠后。这就是结构化内容和 Schema 标记的价值所在。你帮 AI 省了功夫AI 就给你更好的排名。五、第三层信息综合层信息综合层解决的问题是找到了一堆相关内容怎么综合用哪些不用哪些这一层是 AI 搜索最核心的排序筛选环节 决定了哪些内容会被引用、哪些会被忽略。综合信息的几个关键步骤步骤 1召回Recall先从索引里找出所有跟问题相关的内容。 这一步要全尽量把相关的都找出来数量可能很多几十上百个。召回主要看语义相关性——你的内容跟用户问题的向量距离近不近。步骤 2排序Ranking召回的内容太多了需要排个序挑最好的。 排序的因素很多包括相关性内容跟问题的匹配程度权威性网站/作者的可信度、被引用次数时效性内容是不是最新的信息密度内容的质量和价值高低结构化程度内容结构清不清晰AI 好不好提取信息用户反馈信号如果有的话比如点击率、满意度注意这里没有关键词密度、外链数量这些传统 SEO 的概念。 不是说完全不考虑而是权重低了很多。 AI 更看重的是内容质量和语义相关性。步骤 3筛选Selection排序之后选前面 N 个作为参考资料传给下一层去生成答案。 N 的数量取决于模型和问题一般是 5-20 个左右。能进入这 N 个参考资料你的内容才有机会被引用。进不去的话AI 根本看不到你。GEO 优化的主战场就在这一层你做的所有 GEO 优化—— 内容质量优化、结构化优化、权威性建设、Schema 标记…… 最终都是为了在这一层的排序里排得更靠前进入最终的参考资料列表。排得越靠前被引用的概率越高。 进不了前几名基本就没机会了。六、第四层答案生成层答案生成层解决的问题是怎么把筛选出来的参考资料整合成一个流畅的答案这一层就是大模型本身的能力了。生成答案的基本逻辑大模型阅读所有参考资料综合各方信息形成一个完整的回答把回答组织成自然、流畅的人类语言在合适的地方标注引用来源引用是怎么决定的很多人好奇AI 引用谁不引用谁是怎么决定的主要有几个因素信息独特性— 如果你提供了别人没有的信息独家数据、独特观点AI 就会引用你表述清晰度— 如果同样的信息你表述得最清楚、最容易理解AI 就会用你的说法来源权威性— 权威网站的内容AI 更愿意引用排序位置— 排序越靠前的参考资料被引用的概率越高内容完整性— 如果你这篇内容覆盖了问题的多个方面AI 可能多次引用你这里有个很重要的点AI 引用的不一定是排名第一的。排名第一可能整体相关性最高但某个具体的点可能排名第三的那篇讲得更好 那 AI 在讲那个点的时候就会引用排名第三的。这就是为什么**空白地带策略有效**—— 主流话题你可能排不进第一 但某个细分的、具体的点你讲得最好 AI 在讲那个点的时候还是会引用你。积少成多你被引用的次数多了权威性就上去了 排名也会跟着提升形成正向循环。七、理解了架构再看 GEO 该怎么做现在你再回头看 GEO思路就清晰了。GEO 不是玄学它就是针对 AI 搜索引擎每一层的特点做对应的优化AI 搜索层级对应的 GEO 优化方向数据采集层llms.txt 配置、网站速度、可访问性索引存储层结构化内容、Schema 标记、实体优化信息综合层内容质量、权威性、语义相关性答案生成层信息独特性、表述清晰度、可引用性每一层都有优化的空间每一层的优化都会最终反映到 AI 推荐排名上。GEO 就是一个系统工程不是某一个技巧就能搞定的。但也正因为是系统工程它才有壁垒—— 你把每一层都做好了竞争对手想抄不是抄一个技巧就行得抄一整套体系。写在最后AI 搜索还在早期每天都在变。 今天的结论明天可能就不适用了。但有一件事是确定的AI 搜索会越来越重要GEO 会变成每个网站的必修课。越早理解它的工作原理、越早开始布局 你就越有可能在 AI 时代占据一个有利位置。后面我会继续写 GEO 各层的具体优化方法 从技术到内容到权威性一层层拆开讲。可以在来检查网站的geo基建并帮你完善基建感兴趣的可以关注我跟着一起学 GEO。