← 全部研究

超越「最终可见度」:企业 GEO 的三阶段诊断框架

一套受控、阶段隔离的评估方法,把检索、排名、生成三阶段的失败转化为有据可依的站点修订——把留出测试集上的企业 GEO 分从 58.78 提升到 69.98。

一篇 ACL(计算语言学顶会)格式的研究投稿。最终的提及/引用指标只告诉你「可见度丢了」,却没告诉你「在哪一步丢的」。本框架把失败定位到具体阶段。

生成式搜索会在查询匹配、竞争排名、有据生成(grounded generation,即基于给定证据作答)三处引入失败,而传统 SEO 与「最终提及」类指标往往无法定位这些失败。我们提出一套受控的阶段隔离评估(Stage-Isolated Evaluation)框架,把各阶段的特定失败转化为有据可依的站点地图(sitemap)修订。在一项以匿名消费健康公司为对象的产业研究中,每个网站版本都对九个固定竞品、用互不相交的训练 / 验证 / 留出测试查询集进行评估。最终选出的版本把测试分从 58.78 提升到 69.98,比一次性改写高 6.19 分、比同等预算但无诊断的递归改写高 3.07 分。不同阶段偏好不同的版本,揭示出非单调的权衡关系。

问题:聚合的可见度掩盖了「在哪一步丢的」

企业常依赖在商用大语言模型(LLM)平台上反复测试,用召回率、品牌提及、引用频次等孤立指标作反馈。这类依赖平台的测量成本高、不稳定、难复现。更关键的是,它们无法判断一次失败究竟来自内容检索、竞争排名,还是有据生成,导致企业缺乏系统性的诊断依据。

「最终的提及指标只告诉你可见度丢了,却没告诉你它是在检索、排名还是生成哪一步丢的。」

三点贡献:

  1. 阶段隔离评估框架——对企业内容的检索、竞争排名、有据生成分别独立测量。
  2. 递归优化流程——把阶段级诊断信号转化为有针对性的站点修订,并在留出验证集上选出最佳版本。
  3. 在真实竞争场景中评估,证明优化后的内容在泛化到未见查询时仍能整体提升。

方法

阶段隔离评估

对每个查询 q 与目标版本 v,构造一个受控候选集:目标站点 + 九个固定竞品。跨轮次(epoch)只有目标站点变化;查询、竞品、模型版本、提示词、解码参数与评分规则全部固定,候选顺序用固定随机种子打乱。

三个阶段在同一受控条件下独立评估:

  • 检索器(Retriever) —— 衡量「查询与内容的匹配」,独立于竞品集(词法 + 语义的分块相关性)。
  • 重排器(Reranker) —— 竞争相关性:目标在十个候选中排第几。
  • 生成器(Generator) —— 由独立的评估模型按相关性、事实有据、对目标内容的恰当使用打答案质量分;真实性、品牌推荐、断言采纳、归因错误均保留为诊断信号。

仅用于「选版本」时,三阶段分合成 S(v) = 0.3·检索 + 0.3·重排 + 0.4·生成,各自映射到固定的 0–100 区间(边界与版本无关,不从验证/测试集估计归一化统计量)。

递归修订与自然度约束

从原始站点出发,每个优化轮次生成一个修订版。把查询级的检索失败、排名弱项、被遗漏的断言聚合成一个结构化反馈对象,再由修订模型在一份经核验的企业事实文档约束下改写站点——要求改进薄弱内容、同时保持事实一致、不引入无支撑断言。随后一个基于规则的「自然度检查器」过滤掉过度删减/扩写、重复、堆关键词、或事实无支撑的修订;只有保持合理网页结构、且锚定在已核验证据上的版本才有资格入选。验证集与测试集的查询从不用于生成修订反馈。

实验设置

所有目标与竞品站点均由公开网页内容构建。查询集为企业提供的 150 条自然问题,分为三个互不相交的 50 条子集(训练 / 验证 / 测试),意图分布一致(品类需求、场景需求、问题解决、对比、购买决策)。一份经核验的企业事实文档约束修订并评估事实一致性。完整 100 轮优化约 20 小时;检索与重排在本地运行,生成与答案评估通过托管推理服务并发执行。

结果

验证分呈非单调:多数合格版本都优于原始站点,最高聚合验证分出现在第 63 轮(59.82 → 71.93)。各阶段偏好不同版本——生成在第 58 轮见顶,聚合与重排在第 63 轮,检索在第 100 轮——所以「最后一轮」未必最优。

「不同阶段偏好不同的版本,所以最后一轮未必最优——这恰恰是阶段诊断的价值所在。」

我们按聚合验证分(经自然度过滤)选第 63 轮,冻结后在留出测试集上评估:

方法检索重排生成总分
原始站点45.4460.0067.8858.78
一次性改写49.1264.3574.2663.79
递归改写(无诊断)50.8767.9278.1466.91
完整三阶段方法52.7070.9082.2569.98

完整方法整体比原始站点高 11.20 分,比一次性改写高 6.19 分,比无诊断递归高 3.07 分。相对原始站点,检索 / 重排 / 生成分别提升约 8.1 / 12.9 / 14.5 分。

讨论

GEO 表现不仅取决于「包含了什么信息」,更取决于「信息如何组织」。在最佳版本里,相关定义、安全机制、证据与履约能力被归并成连贯、可抽取的单元,从而更易被检索、排名、用于有据生成。由于聚合分会掩盖站点究竟弱在匹配、竞争相关性还是有据使用——且各阶段最佳版本并不相同——企业 GEO 应被当作一个多目标优化问题。实践中,内容团队可以定位最弱的诊断维度、修订对应字段、再重评三个阶段,这比「一刀切改写」或「直接取最后一轮」更具可操作性。

「企业 GEO 应被当作一个多目标优化问题——聚合分会掩盖你究竟弱在匹配、竞争相关性还是有据使用。」

局限与伦理

离线框架无法完全复现商用生成式搜索系统(实时索引、私有检索、用户个性化);离线分应被解读为受控诊断指标,而非某一平台上的真实概率。本研究只考察一家匿名公司、单一领域、单一目标站点、九个竞品与固定查询集,跨行业 / 语言 / 内容类型的泛化性尚未确立。所有网站与竞品内容均来自公开来源;查询经人工审核,不含任何可识别个人信息。修订提示词明令禁止无支撑断言、伪造证据与误导性健康信息;每个生成站点都受已核验事实文档约束。该系统仅用于内容评估与优化,不用于临床诊断、治疗决策或个性化医疗建议

参考文献

  • Aggarwal, P., 等. GEO: Generative Engine Optimization. arXiv:2311.09735, 2023.
  • Bagga, P. S., 等. E-geo: A testbed for generative engine optimization in e-commerce. arXiv:2511.20867, 2025.
  • Chen, Q., 等. Beyond keywords: content-centric agents for GEO. arXiv:2509.05607.
  • Kim, S., 等. SAGEO arena. arXiv:2602.12187, 2026.
  • Schulte, J., 等. Don’t measure once: Measuring visibility in AI search (GEO). arXiv:2604.07585, 2026.
  • Wu, Y., 等. What generative search engines like and how to optimize web content cooperatively. arXiv:2510.11438, 2025.
  • Zhang, K., He, X., Yao, J. From citation selection to citation absorption. arXiv:2604.25707, 2026.