← 全部研究

BASELINE 平台如何应对中文 AI 引擎引用源碎片化挑战

技术白皮书——从研究揭示的四个核心问题(碎片化、赢家通吃、选源不对称、口径陷阱),到平台从架构层面系统化应对的七项设计。

技术白皮书。

基于对四个行业、2,307 条品类词查询、六大中文 AI(人工智能)引擎的实证研究,我们发现 AI 引擎的引用源生态呈现出高度碎片化、引擎间低重叠、赢家通吃三大特征。这些发现意味着传统的搜索引擎优化(SEO)方法论在 AI 搜索时代存在系统性盲区——生成式引擎优化(GEO)这一概念,正是由普林斯顿团队在数据挖掘顶会 KDD 2024 上首次系统化提出(arXiv:2311.09735)。本文论述 BASELINE GEO(生成式引擎优化)评估平台如何从架构层面系统性地应对这些挑战——从六引擎全覆盖取证、引擎选源分歧量化、Rank 门控(排名分档)诊断建议,到独立的 GEO 五维评分体系。

一、研究揭示的四个核心问题

1. 引擎碎片化:六个引擎,六套信息世界。 跨四个行业的实证显示:任意两个引擎引用源的重叠度极低(平均 Jaccard 系数 2.1%–8.7%),跨行业独占域名占比 89.9%–92.4%,AI 引用源与百度排名重叠仅 0.7%。结论:每个 AI 引擎构建了自己独立的「信息世界」。只优化一个引擎不等于覆盖了 AI 搜索——客户在 DeepSeek 上被引用,不代表在豆包上也能被引用。

「每个 AI 引擎都构建了自己独立的信息世界——在 DeepSeek 上被引用,并不代表在豆包上也会被引用。」

2. 赢家通吃:排名第一的品牌获得不成比例的提及。 在品类词查询中,提及率最高的品牌通常获得第二名的 1.5–2 倍提及量。AI 引擎倾向于强化已有的品牌认知——头部品牌被反复引用,尾部品牌几乎不可见。

3. 引擎选源不对称:同一品牌在不同引擎的表现差异巨大。 同一品牌在六个引擎间的提及率方差很大,差距可达 14 个百分点。这意味着客户无法用单一策略覆盖所有引擎。

4. 口径陷阱:品类词与品牌词的系统性偏差。 当查询中包含品牌名时(如「品牌 X 怎么样」),该品牌几乎必然被 AI 提及——这不是 GEO 效果,而是查询本身的语义引导。混算品牌词和品类词会将提及率系统性虚高约 11 倍,产生虚假的乐观信号。

「混算品牌词与品类词,会把品牌的真实可见度系统性虚高约 11 倍——好看的数字,往往只是口径的错觉。」

二、平台的系统化应对

2.1 六引擎全覆盖取证

引擎碎片化意味着单引擎评估没有代表性。平台用召回(recall)主管线驱动浏览器自动化工具 Playwright,对六个必选引擎(DeepSeek / 豆包 / 通义千问 / 元宝 / Kimi / 文心一言)进行全覆盖网页端取证,每个引擎配 3 账号轮换容灾。每次取证完整保存 AI 回答文本 + 引用源网址(URL)+ 截图作为证据链。取证编排器支持断点续跑、风控自动降级(同号重试→换号→跳引擎),确保大规模取证(单客户 >2,000 条)的可靠性。

全引擎声量份额(Share of Voice): 通过 combine_engines_sov 将六引擎的召回数据合并为统一口径的声量视图,客户一键看到「在所有 AI 引擎中,我和竞品各占多少可见度」,而不是逐引擎手动对比。

2.2 引擎选源分歧分析

针对引擎选源不对称,平台在召回聚合层新增「引擎选源分歧」(engine mention divergence)指标:对每个品牌,计算其在各引擎间提及率的离散程度(最大/最小比值 + 方差),自动标注「引擎间高分歧品牌」——即那些在某个引擎表现极好但在另一个引擎几乎不可见的品牌。该指标已接入召回白皮书(以标注框展示「该品牌在引擎间存在显著分歧」,并给出具体差异,如「文心提及率 53%,豆包仅 4%」)与平台能见度页(前端以提示条展示)。

2.3 Rank 门控(排名分档)诊断建议

赢家通吃效应意味着品牌在传统搜索中的排名直接影响其在 AI 回答中的可见度,但不同排名段需要不同的 GEO 策略。平台引入「Rank 门控」(排名分档),将传统搜索引擎排名分为三档:

档位排名区间GEO 策略建议
HEAD(头部)Top 10已有强搜索基础,GEO 重点是确保 AI 引擎能「找到并引用」已有的高质量内容
CHALLENGER(挑战者)11–50有内容积累但排名未进首页,GEO 重点是内容结构化 + AI 可读性优化
UNRANKED(无排名)50+ 或无排名几乎无传统搜索存在感,GEO 需从内容建设起步

排名数据走双数据源:百度搜索结果页(Playwright 实时抓取、解析真实网址、过滤广告)与 Google Search Console 接口(走官方合规通道,通过 OAuth 授权获取已验证站点的平均排名)。Rank 门控确保诊断建议符合品牌的实际搜索地位,而不是给无排名品牌空泛的「优化内容结构」建议。

2.4 独立的 GEO 五维评分体系

AI 引用源与百度排名重叠仅 0.7%,证明传统 SEO 指标(排名、外链、权重)无法预测 AI 可见度。客户需要一个完全独立于 SEO 的评估体系——五维评分,专为 AI 引擎可见度设计:

维度评估内容数据来源
召回率(Recall)AI 是否在回答中提及了该品牌recall 取证(品类词查询)
引用率(Citation)AI 是否将该品牌的域名作为引用源recall 取证(引用源网址提取)
准确率(Fidelity)AI 对该品牌的描述是否准确事实保真审计(准确 / 错误 / 未提及)
声量(Share of Voice)该品牌占同品类所有提及的比例share_of_voice 聚合
竞争态势(Competition)竞品词查询中 AI 站谁compete.py 判定(五态结论)

评分草稿由 AI 自动生成(L3 草稿层),经人工核对后升为最终评分(L1 最高层)。「宁漏勿冤」原则意味着宁可低估也不夸大品牌在 AI 中的表现。

2.5 品类词 / 品牌词 / 竞品词三分离口径

混算品牌词和品类词会将提及率系统性虚高约 11 倍。平台对三类查询严格分离,各有独立评估逻辑:品类词(不含品牌名)走召回主战场算声量;品牌词(含我方品牌名)验证 AI 是否能正确描述该品牌(保真);竞品词(含竞品名)判定 AI 站谁。关键设计决策: 声量份额仅基于品类词计算;品牌词查询天然会触发该品牌的提及,纳入会系统性高估。平台在设置页支持编辑「用于召回匹配的词」(品牌别名),确保召回匹配的准确性。

2.6 AI 友好度诊断

即使品牌在 AI 回答中被提及,如果官网本身对 AI 爬虫不友好,引用率也会受影响。平台提供八项检查器的域名级 AI 友好度体检:抓取准入(robots.txt 是否放行主流 AI 爬虫)、发现性(页面是否可被 AI 爬虫发现)、结构化数据(JSON-LD 是否存在且正确)、中文本地化、中文实体、内容质量、HTML 结构语义化、Agent 可达性(L0–L3 代理可达性分级)。另有内容伪装(cloaking)检测——以浏览器与爬虫两种身份(UA)交叉验证网站是否对不同身份返回不同内容(一种可能被 AI 引擎惩罚的黑帽手法)。

2.7 质量门与可溯源

对外报告中出现裸数字或不可溯源的结论会损害可信度。平台内置质量门(溯源自检),在报告生成时自动拦截:无裸数字(所有数字必须标注来源,如「5/6 引擎引用」而非「83%」)、禁百分比(对外白皮书使用「X 次中 Y 次」形式,避免小样本百分比的误导)、无悬空引用(每个引用标记必须有对应的证据条目)。所有证据以 append-only(只增不改)方式存储(日期批次 + manifest 清单),确保可审计性。

三、平台架构概览

四个子系统互相独立,各产出独立的网页报告和 JSON 数据:

  • recall · 召回主管线 —— 6 引擎取证 → 五维评分 → 声量聚合。
  • diagnostic · 官网 AI 友好度 —— 8 项检查 + Agent 可达性。
  • weights · 引用来源权重 —— 来源 × 引擎矩阵。
  • benchmark · 引擎行为基准 —— 标准题集 + 威尔逊(Wilson)置信区间。

webapp(公网多租户平台,FastAPI + React)作为统一对外入口,聚合四个子系统的数据为客户提供一站式 GEO 评估看板(8 页数据看板,租户隔离);console(运维编排,12 阶段流水线)经 webapp 管理后台访问,与租户登录完全解耦。

四、数据规模与验证

截至 2026 年 6 月,平台已完成以下规模的数据采集与评估:

行业品类词数引擎数证据条数
营养补剂1,60063,420
户外广告320216
OTC 药品22551,125
男士护肤1626972
合计2,3075,533

跨行业核心发现高度一致(独占域名占比 89.9%–92.4%,引擎间 Jaccard 1.9%–8.7%),这种跨行业稳健性验证了「AI 引擎引用源碎片化」不是单一行业的偶然现象,而是 AI 搜索时代的结构性特征。

五、结论

AI 搜索引擎的引用源生态与传统搜索引擎排名存在本质差异。传统 SEO 优化的是「排名」,GEO 优化的是「被 AI 引用」。这两者之间的关系几乎为零(重叠 0.7%)。

「传统 SEO 优化的是排名,GEO 优化的是被 AI 引用——而这两者之间的重叠几乎为零。」

BASELINE 平台的系统化应对可以归纳为一个原则:不假设任何两个引擎的行为一致,不假设 AI 可见度等同于搜索排名,用实证数据驱动每一个诊断结论。 具体而言:全覆盖(六引擎取证)、量化分歧(让引擎间差异可见、可行动)、分层诊断(Rank 门控)、独立体系(五维评分完全独立于 SEO)、口径严谨(三分离消除系统性偏差)、证据可溯(append-only 证据链 + 质量门拦截不可信结论)。

参考文献


本文数据来自 BASELINE GEO 平台对四个行业客户的实证评估,所有结论可通过平台证据链验证。品牌名称已匿名化处理。