AI 搜索与答案生成机制:从提问到回答的完整管线
AI 搜索回答一个问题,不是「搜索→展示」的简单动作,而是一条检索→评分→装配→生成的多阶段管线。本文拆解 6 个核心问题:① AI 搜索的 8 阶段管线与 3 关漏斗如何互补描述同一过程;② 训练记忆 vs 实时搜索的本质区别及对 GEO 的意义;③ RAG 如何覆盖管线 6 个阶段成为 AI 搜索的技术骨架;④ AI 如何通过实体识别+意图分类+上下文+改写理解用户意图;⑤ AI 为什么会改写用户问题(4 个原因+Query Fan-out 机制);⑥ AI 如何从多个网页中提取和综合答案(检索→评分→装配→生成的完整链路)。
AI search answering a question is not a simple 'search→display' action but a multi-stage pipeline of retrieval→scoring→assembly→generation. This article dissects 6 core questions: ① How the 8-stage pipeline and 3-gate funnel complementarily describe the same process; ② The essential difference between training memory and real-time search and what it means for GEO; ③ How RAG covers 6 stages to become the technical backbone of AI search; ④ How AI understands user intent through entity recognition + intent classification + context + rewriting; ⑤ Why AI rewrites user queries (4 reasons + Query Fan-out mechanism); ⑥ How AI extracts and synthesizes answers from multiple web pages.
AI 搜索与答案生成机制:从提问到回答的完整管线
这是 GEO 学习笔记的第二章——解决「模型怎么理解、检索、选择和组织答案」的问题。第一章建立了「什么在变、为什么变」的宏观认知,这一章进入 AI 搜索的内部机制。
一、AI 搜索回答一个问题经历了哪些步骤
核心框架:8 阶段管线
AI 搜索的完整过程可以分解为 8 个阶段——来自 GU 第二场公开课(2026):
① 记忆 → ② 索引 → ③ 查询 → ④ 检索 → ⑤ 重排 → ⑥ 装配 → ⑦ 引用 → ⑧ 治理
| # | 阶段 | 做了什么 | GEO 可控性 |
|---|---|---|---|
| ① | 记忆 | 模型训练数据中的既有知识和偏好 | 不可控 |
| ② | 索引 | 信源被抓取、入库,进入可检索范围 | 可控 — 信源策略 |
| ③ | 查询 | 实体识别 + 意图识别 + 上下文 + Query Fan-out 拆子查询 | 间接 — 选题/Schema |
| ④ | 检索 | 向量召回 + 关键词匹配,拉回候选集 | 可控 — 关键词/覆盖 |
| ⑤ | 重排 | 对候选集打分、排序、截断 | 核心可控 — 内容质量 |
| ⑥ | 装配 | 选择并组织最优证据,构建回答上下文 | 核心可控 — 段落结构 |
| ⑦ | 引用 | 将装配结果生成为最终答案,标注来源 | 核心可控 — 表达层 |
| ⑧ | 治理 | 用户反馈(点赞/分享/重新生成)→ 优化 | 长尾 — 品牌口碑 |
⑤⑥⑦ 是 GEO 的主战场。 这三个阶段直接由内容质量决定,是品牌能真正发力的地方。前 4 阶段解决「有没有」,后 3 阶段解决「选不选、装不装、引不引」。
阶段③的放大:Query Fan-out
阶段③「查询」中有一个关键机制——Query Fan-out:用户只问了一句话,AI 在后台拆成 8-12 个子查询并行搜索。
用户:"哪个 CRM 系统最适合电商团队?"
AI 拆解:
→ "电商CRM系统推荐"
→ "CRM系统核心功能电商"
→ "电商团队CRM价格对比"
→ "中小电商CRM选型指南"
→ "Salesforce vs HubSpot 电商"
→ "电商CRM集成能力"
→ ...
73% 的扇出子查询每次搜索都会变化——今天和明天拆出来的子问题可能完全不同。这意味着 AI 不是在查固定的关键词库,而是在每次对话中动态生成检索策略。
内容侧视角:3 关卡漏斗
从内容侧(而非 AI 侧)看同一个过程,是三道关卡逐层过滤:
| 关卡 | 问题 | AI 看什么 | 通过率 |
|---|---|---|---|
| 第一关:抓 | 页面能不能被 AI 爬虫抓到? | robots.txt、sitemap、付费墙 | ~100%(基础配置到位) |
| 第二关:翻 | AI 会不会「点开」你的页面? | URL、标题、摘要、时间戳(看不到正文) | 取决于爬虫策略 |
| 第三关:摘 | 翻开了,AI 能不能提取可用内容? | 答案是否前置、段落是否独立、有无可引用数据 | ~15%(85% 流失) |
整体转化率:100% × 检索率 × 15% — 绝大多数内容通过了前两关,但最终只有约 15% 被真正引用。
两套框架的对应关系
8 阶段管线和 3 关漏斗是同一过程的不同视角——前者从 AI 侧描述内部步骤,后者从内容侧描述筛选关卡:
8 阶段管线 3 关卡漏斗 核心动作
────────── ───────── ────────
② 索引 第一关 抓 内容入库
③ 查询 + ④ 检索 第二关 翻 候选集生成
⑤ 重排 + ⑥ 装配 + ⑦ 引用 第三关 摘 最终引用决策
一图总结:从用户提问到 AI 回答
用户提问
│
▼
③ 查询阶段:实体识别 + 意图识别 + Query Fan-out(拆 8-12 个子查询)
│
▼
④ 检索阶段:多子查询并行 → 向量召回 + 关键词匹配 → 拉回候选集(12+ 信源)
│
▼
⑤ 重排阶段:9 维评分(语义/权威/信息密度/时效/噪音等)→ 排序截断
│
▼
⑥ 装配阶段:选取最优证据块,组织上下文
│
▼
⑦ 引用阶段:生成最终答案 + 标注 2-7 个引用来源
│
▼
用户看到回答 → ⑧ 反馈优化(点赞/分享/重新生成 → 影响后续检索)
二、训练记忆 vs 实时搜索:AI 的两种「知识」
两者的区别可以归结为一句话:训练知识是 AI「脑子里记住的」,实时搜索是 AI「临时去查的」。
核心对比
| 对比维度 | 训练记忆 | Grounding(实时搜索) |
|---|---|---|
| 信息来源 | 预训练数据(互联网文本) | 实时检索(网页/文档/数据库) |
| 时效性 | 截止于训练日期 | 可获取最新信息 |
| 准确性 | 可能过时或幻觉 | 依赖源内容质量 |
| 更新方式 | 需重新训练(不可实时) | 实时查询 |
| GEO 可控性 | 低 — 无法控制训练数据 | 高 — 可通过内容优化影响 |
训练知识:AI「脑子里记住的」
来源:在几乎整个互联网的文本上做「预测下一个词」(自监督学习)
学到什么:语法、常识、推理能力、世界知识 — 相当于「读完一座图书馆」
截止日期:训练数据有固定截止日期,之后发生的事情 AI 不知道
关键特性:
· 预训练决定了模型的知识天花板,后训练无法注入大规模新知识
· 基座模型「知识渊博但只会接话茬」,需要后训练才能当助手
· 可能产生幻觉 — 说得像真的但实际上是错的
预训练像让一个人读完一座图书馆,肚子里装满了学问——但他不知道图书馆闭馆之后发生了什么。
实时搜索:AI「临时去查的」
实时搜索在 8 阶段管线中对应阶段 ②-⑦:
① 记忆(训练知识,不可控)
↓
② 索引 → ③ 查询 → ④ 检索 → ⑤ 重排 → ⑥ 装配 → ⑦ 引用
└────────── 实时搜索获取外部信息 ──────────┘
工作流程:
- 用户提问 → AI 不直接回答,先启动 Grounding
- Query Fan-out:拆成 8-12 个子查询并行搜索
- 检索召回候选页面(阶段 ④)
- 重排打分、截断(阶段 ⑤)
- 装配最优证据 → 生成答案 → 标注引用来源(阶段 ⑥⑦)
为什么需要实时搜索:阶段 ① 的训练记忆不可靠——可能过时、可能幻觉、无法覆盖最新信息。Grounding 让 AI 能获取训练截止日期之后的实时信息。Grounding 是 Citation(AI 引用来源)的前提——没有 Grounding,通常就没有 Citation。
AI 搜索 = 两者结合(RAG 模式)
现代 AI 搜索既不是纯粹靠训练记忆,也不是完全抛弃训练记忆,而是 RAG(检索增强生成) 模式:
| 用途 | 来源 |
|---|---|
| 理解你问什么、判断上下文、组织语言、推理 | 训练记忆(语言能力 + 世界知识) |
| 找最新的、准确的、可溯源的事实信息 | Grounding 实时搜索(网页检索) |
| 两者整合 | AI 综合「自己知道什么」+「搜到了什么」,生成最终答案 |
用户提问 → 查询扇出(8-12 个子查询)→ 并行搜索 → 找到相关内容片段
→ 塞给大语言模型 → 综合生成答案 → 标注引用来源
AI 只能从它实际抓取到的内容里生成回答。
不是「互联网上存在什么」,不是「什么是正确的」,
而是「那次搜索实际拉回来了什么」。
这对 GEO 的意义
| 如果 AI 只靠训练记忆 | 如果 AI 用实时搜索 |
|---|---|
| 品牌信息可能过时、失真 | 品牌可以通过内容影响 AI 回答 |
| 无法控制 AI 对品牌的描述 | 优化官网、百科、媒体内容 = 直接提升 AI 引用 |
| GEO 几乎无从下手 | GEO 的核心:让内容成为 Grounding 时容易被找到和采用的材料 |
GEO 很重要的部分不是「让 AI 永久记住我」,而是让 AI 在需要时能「查到真实、准确、最新的我」。
三、RAG 在 AI 搜索中承担什么作用
RAG = 「先查再答」
RAG = Retrieval-Augmented Generation(检索增强生成)。用户提问 → 检索资料库 → 把相关片段拼到 prompt → 让模型生成带引用的答案。
没有 RAG 就没有 AI 搜索。 如果 AI 只靠训练记忆(阶段①),它无法回答训练截止日期之后的问题,也无法引用最新来源。RAG 就是让 AI「先上网查、再用自己的脑子组织答案」。
RAG 在 AI 搜索 8 阶段管线中的位置
AI 搜索 8 阶段 RAG 对应环节 RAG 的作用
──────────────────────────────────────────────────────────
① 记忆(训练知识) → 不参与 提供语言理解和推理能力
② 索引 → 步骤 1-6 将外部内容向量化入库
(接入→解析→切片
→向量化→存储)
③ 查询 + ④ 检索 → 步骤 7-8 向量检索 + BM25 混合检索
(Query Fan-out 拆子查询)
⑤ 重排 → 步骤 9 Reranker 对候选集重新打分
提升幅度最大:+10-20% 命中率
⑥ 装配 + ⑦ 引用 → 步骤 10 将检索结果拼入 prompt
模型生成带 [n] 引用的答案
⑧ 治理 → 反馈闭环 用户反馈优化检索质量
RAG 覆盖了 AI 搜索管线中 ②-⑦ 共 6 个阶段,是真正支撑 AI 搜索的技术骨架。
RAG 的三个核心作用
1. 解决「知识截止」问题
| 只靠训练记忆 | 加上 RAG |
|---|---|
| 知识截止于训练日期 | 可获取最新信息 |
| 可能幻觉、捏造事实 | 答案有来源可追溯 |
| 品牌无法控制 AI 描述 | 品牌可通过优化内容影响 AI 引用 |
Grounding 是应对幻觉的核心手段。GEO 不能只想着「让 AI 永久记住我」,而是要让 AI 在需要时能「查到真实、准确、最新的我」。
2. 提供「可溯源引用」
没有 Grounding → 最多 Mention(AI 提到但不给链接)
有 Grounding → 才有 Citation(AI 明确标注来源)
Citation 的价值远高于 Mention — 它意味着 AI 把你的内容当作依据
3. 决定「GEO 主战场在哪里」
RAG 中可被 GEO 优化的三个关键节点:
| RAG 步骤 | 对应 8 阶段 | GEO 优化方向 |
|---|---|---|
| 检索(7-8) | ④ 检索 | 关键词布局、信源覆盖 |
| 重排(9) | ⑤ 重排 | 内容质量(权威引用、统计数据) |
| 生成(10) | ⑥⑦ 装配+引用 | 段落结构、可引用块、表达层 |
这三个阶段正是 GEO 内容工程的主战场——它们直接由内容质量决定。
RAG 完整流程一图总结
用户问:"2026 年最好的 CRM 是哪个?"
│
▼
┌── RAG 检索 ──────────────────────────────────────┐
│ ③ Query Fan-out:拆成 8-12 个子查询并行搜索 │
│ ④ 检索:向量召回 + 关键词匹配 → 候选集 12 篇 │
│ ⑤ 重排:Reranker 打分 → 截断到 top 5 │
│ ⑥ 装配:组织最优证据块 │
└──────────────────────────────────────────────────┘
│
▼
┌── RAG 生成 ──────────────────────────────────────┐
│ ⑦ LLM 综合「训练记忆(语言能力)」 │
│ + 「检索来的 5 篇内容(事实依据)」 │
│ + 标注引用来源 [1][2][3] │
│ → 生成最终答案 │
└──────────────────────────────────────────────────┘
四、AI 如何理解用户问题意图
AI 理解用户意图不是一步完成的,而是通过阶段③「查询」中的多机制协同。
核心机制:8 阶段管线中的「查询」阶段
③ 查询 = 实体识别 + 意图识别 + 上下文 + 改写 + Query Fan-out
| 子步骤 | 做什么 | 例子 |
|---|---|---|
| 实体识别 | 提取问题中的关键实体(品牌/产品/人名/地名) | 「佛山哪家火锅好吃」→ 实体:佛山、火锅 |
| 意图识别 | 判断用户到底想要什么(信息/比较/购买/解决) | 「哪家」→ 比较评估型 |
| 上下文 | 结合对话历史理解当前问题 | 上一轮问过「川渝火锅」→ 这次锁定川渝 |
| 改写 | 将口语化问题重写为更精准的检索查询 | 「佛山哪家火锅好吃」→ 「佛山火锅店推荐 口碑评分」 |
| Query Fan-out | 拆成多个子查询并行搜索 | 见下方详细展开 |
意图分类:AI 如何判断「你想要什么」
经典 3 类(SEO + GEO 共有):
| 意图类型 | 触发信号 | AI 的行为 |
|---|---|---|
| 信息型 | 「什么是」「怎么工作」 | 提取定义和概念解释 |
| 导航型 | 品牌名、产品名 | 检索官网/产品页 |
| 交易型 | 「哪个好」「多少钱」「推荐」 | 提取对比数据、价格、评测 |
AI 新增 2 类:
| 意图类型 | 触发信号 | GEO 价值 |
|---|---|---|
| 创作型 | 「帮我写」「帮我生成」 | 低 — AI 自己生成,不引用外部 |
| 灵感型 | 「有哪些创意」「推荐方案」 | 低 — 同上 |
GEO 最值得覆盖的意图:信息型 + 交易型——品牌最容易进入 AI 回答的地方。
按用户决策旅程细分为 5 种意图
| 意图 | 用户状态 | 触发词 | GEO 转化价值 |
|---|---|---|---|
| 认知型 | 还不知道是什么 | 「什么是 GEO?」 | 低 — 建立认知 |
| 方案探索型 | 想知道有哪些选项 | 「电商 GEO 有哪些方案?」 | 中 — 进入候选集 |
| 评估调查型 | 想比较哪个更好 | 「Asana 和 Monday 有什么区别?」 | 高 — 接近决策 |
| 购买决策型 | 想确认值不值得 | 「索尼 WH-1000XM5 值得买吗?」 | 最高 — 临门一脚 |
| 问题解决型 | 想解决具体问题 | 「网站不被 AI 收录怎么办?」 | 中 — 展示专业度 |
评估调查型和购买决策型含「高意图信号词」(最佳、对比、值得吗),用户离行动最近,GEO 转化价值最高。
从关键词到意图词:理解机制的范式升级
SEO 时代(关键词匹配) GEO/AI 时代(意图理解)
───────────────── ─────────────────
匹配「佛山火锅」 理解「佛山+35岁+家庭聚餐+哪家火锅环境好」
单一词汇匹配 用户身份 + 使用场景 + 搜索意图 三要素融合
字面匹配 语义匹配
意图词 = 用户身份(Who)+ 使用场景(When/Where)+ 搜索意图(What/Why)
AI 通过训练学到的语义理解能力,能从「佛山哪家火锅适合家庭聚餐」这句话中同时提取出:用户身份(家庭用户)、场景(佛山、聚餐)、意图(推荐/比较),三者综合决定检索策略。
AI 理解意图的完整链路
用户输入:"佛山哪家火锅适合家庭聚餐?"
│
▼
① 实体识别:佛山(地域)、火锅(品类)、家庭聚餐(场景)
② 意图识别:评估调查型(比较+推荐)→ 高价值意图
③ 上下文融合:结合对话历史判断是否需要限定条件
④ 改写:"佛山火锅店推荐 家庭聚餐 口碑评价"
⑤ Query Fan-out:拆成 N 个子查询并行检索
│
▼
进入阶段④ 检索 → 阶段⑤ 重排 → ...
核心洞察:
- AI 不是「匹配关键词」,而是理解完整的语义意图(实体 + 意图 + 场景)
- GEO 的内容策略必须从「关键词覆盖」升级为「意图覆盖」——不再问「这个词排第几」,而是问「我的内容能不能回答用户的真实问题」
- 意图越具体、越接近决策,内容的 GEO 价值越高
五、AI 为什么会改写用户的问题
AI 改写用户问题,是因为用户说的不是检索系统能直接用的。核心发生在 8 阶段管线的阶段③「查询」。
四个原因
1. 自然语言 → 检索查询的翻译
用户用自然语言提问(「哪个 CRM 最适合电商团队?」),但检索系统(向量库 + BM25)需要结构化查询。AI 必须把对话式问题翻译成搜索引擎能理解的查询语句。这是「关键词检索→对话式交互」转变的另一面——AI 在中间做反向翻译。
2. 复杂问题 → 多个子查询(Query Fan-out)
一个用户问题背后,AI 会拆出 8-12 个子查询并行搜索:
用户问:"哪个 CRM 系统最适合电商团队?"
AI 改写为:
→ "电商CRM系统推荐"
→ "CRM系统核心功能电商"
→ "电商团队CRM价格对比"
→ "中小电商CRM选型指南"
→ "Salesforce vs HubSpot 电商"
→ "电商CRM集成能力"
73% 的扇出查询每次搜索都会变化——同一个问题今天和明天拆出的子查询可能完全不同。
3. 上下文注入(多轮对话历史)
AI 搜索是对话式的,用户会连续追问。改写阶段会把前几轮的对话上下文注入当前查询:
用户第一轮:"什么是 RAG?"
用户第二轮:"它怎么提升准确性?"
→ AI 改写时把「它」解析为「RAG」
→ 实际检索:"RAG 如何提升准确性"
4. 实体消歧
用户问题中的词可能有多重含义。改写阶段需要识别实体并消歧——「苹果」是指水果还是公司?「Python」是语言还是蛇?这一步确保检索时命中正确的内容。
改写 = 意图词转换
从意图词视角看,改写本质上是在做关键词 → 意图词的升级:
| 用户输入 | AI 改写后的意图词结构 |
|---|---|
| 「CRM 选型」 | 「电商团队 + 预算有限 + CRM 选型指南」 |
| 「养老金」 | 「上海 + 35岁职场女性 + 养老金配置方案」 |
AI 自动补全了 用户身份 + 使用场景 + 搜索意图 三要素,把信息稀薄的关键词变成语义完整的意图词。
GEO 视角:改写阶段可控吗?
8 阶段管线中,阶段③(查询/改写)标记为 间接可控。你无法直接控制 AI 怎么改写,但可以通过以下方式影响:
| 影响方式 | 具体做法 |
|---|---|
| 选题策略 | 覆盖用户可能问的完整问题空间(而非只盯关键词) |
| 内容结构 | 用意图词结构组织标题和 H2/H3(如「XX场景下如何选择YY」) |
| Schema 标记 | 帮助 AI 正确识别你的内容实体和意图类型 |
六、AI 如何从多个网页中提取答案
AI 从多个网页中提取答案,不是一个「搜索→展示」的动作,而是一个检索→评分→装配→生成的多阶段管线。核心发生在 8 阶段管线的阶段 ④⑤⑥⑦。
完整链路
多个网页(候选集 12+ 信源)
│
▼
阶段④ 检索:向量召回 + 关键词匹配 → 拉回所有相关页面
│ 返回 12+ 个候选页面
▼
阶段⑤ 重排:9 维评分打分 → 排序 → 截断
│ 从 12+ 截断到 top 5-7
│ 评分维度:语义相关度、权威可信度、信息密度、结构可用性、
│ 实体对齐度、时序匹配、新鲜度、冗余惩罚、噪声鲁棒性
▼
阶段⑥ 装配:选取最优证据块
│ 从 top 5-7 页面中提取最相关的段落和 Chunk
│ 组织成连贯的回答上下文
│ 去重、压缩、排序(不是简单拼接)
▼
阶段⑦ 引用:LLM 综合生成答案
│ 综合「训练记忆(语言组织能力)」+「检索来的最优证据块」
│ 生成最终回答
│ 标注 2-7 个引用来源 [1][2][3]
│ 事实主张必须有检索结果支撑——不能凭空编造
▼
用户看到综合答案 + 引用来源
关键机制:AI 不是「直接引用网页」,而是「提取最优证据块」
❌ 错误理解:
AI 找了 5 个网页 → 选最好的 1 个 → 把那个网页的内容展示给用户
✅ 实际过程:
AI 找了 5 个网页 → 从每个网页中提取最相关的 Chunk →
综合多个 Chunk 生成一段新答案 → 标注每个 Chunk 的来源
这意味着:你的网页不需要「整篇都是最优」——只需要其中有「最优的证据块」就能被 AI 摘取和引用。 这进一步验证了语义切片和结构化写作的重要性:一个结构清晰、答案前置、每个 H2 都能独立回答一个问题的页面,在装配阶段被摘取的概率远高于一篇把答案埋在第八段的长文。
装配阶段的三个核心动作
| 动作 | 做什么 | GEO 启示 |
|---|---|---|
| 去重 | 多个页面说同一件事 → 只保留最权威、最清晰的版本 | 写出差异化的独特观点,不做信息搬运工 |
| 压缩 | 把长段落压缩成可用的证据块 | 每个 Chunk 本身就应该是一个「可独立引用的压缩单元」 |
| 排序 | 按相关性、权威性、时效性排列证据 | 在相关性和权威性上同时下注,不偏废 |
七、第二章总结:AI 搜索的完整逻辑链路
用户用自然语言提问
│
▼
AI 理解意图(阶段③)
├── 实体识别:提取关键实体
├── 意图分类:判断用户想要什么(信息/比较/购买/解决)
├── 上下文注入:融合对话历史
└── 改写 + Query Fan-out:拆成 8-12 个子查询
│
▼
检索召回(阶段④)
├── 向量语义召回 + BM25 关键词匹配
└── 拉回 12+ 信源候选集
│
▼
评分截断(阶段⑤)← GEO 主战场 1
├── 9 维评分(语义/权威/密度/结构/实体/时序/新鲜度/冗余/噪声)
└── 从 12+ 截断到 top 5-7
│
▼
证据装配(阶段⑥)← GEO 主战场 2
├── 去重、压缩、排序
└── 组织最优证据块拼入 prompt
│
▼
答案生成(阶段⑦)← GEO 主战场 3
├── LLM 综合「训练记忆」+「检索证据」
└── 生成答案 + 标注 2-7 个引用来源
│
▼
用户看到答案 → 反馈优化(阶段⑧)
第二章的三个核心洞察:
-
训练记忆 + 实时搜索 = AI 搜索的完整能力。训练记忆提供语言理解和推理,实时搜索提供最新的事实依据。GEO 的发力点在后者——让内容成为 Grounding 时容易被找到和采用的材料。
-
RAG 是 AI 搜索的技术骨架。它覆盖了 8 阶段管线中 ②-⑦ 共 6 个阶段。没有 RAG 就没有 Citation,没有 Citation 就没有 GEO。
-
GEO 的主战场在阶段 ⑤⑥⑦——重排(内容质量决定排名)、装配(段落结构决定被选中的概率)、引用(表达层决定最终呈现)。这三个阶段直接由内容质量决定,是品牌能真正发力的地方。