GEO · 生成式引擎优化评估

AI 引擎里,
你的品牌被怎么说?

用户已经在 DeepSeek、豆包、通义里做购买决策。BASELINE 实测 6 个中文 AI(人工智能)引擎对你和竞品的真实回答——提及了谁、引用谁的内容、把谁排在前面。确定性规则、原始计数、每个数字可点回原始截图。

不是又一个“包上首页”的承诺。是一次诚实的测量。

6
个必测中文 AI 引擎
DeepSeek · 豆包 · 通义 · 元宝 · Kimi · 文心
5
维确定性评分
4 维纯规则·零大模型 · 1 维人工复核
100%
数字可溯源
每个计数点回原始回答与截图

为什么是现在

决策层正在从搜索框迁移到对话框

当用户不再翻十条蓝色链接、而是直接问 AI“找谁靠谱”,你的品牌要么被写进那段答案,要么根本不存在。这是一个全新的、你看不见的货架。

01

看不见,直到客户截图发来

搜索引擎你还能查排名;AI 的回答因人、因问法、因时间而变,你没有仪表盘——除非有人替你逐条实测

02

大多数“优化”无效或会漂移

学术基准 C-SEO Bench(机器学习顶会 NeurIPS 2025)显示:「很多 GEO 优化手段在真实条件下并不稳定,效果会随模型迭代与竞争而漂移」。唯一稳定的价值,是可信的测量

03

被提到 ≠ 被说对

普华永道(PwC)的研究发现 AI 回答里链接有效率 >94%,但事实准确率只有 39–77%。AI 可能提到你,却把你说窄、说错、说成“备胎”。

我们的取向

先测量,再优化

我们不卖玄学。BASELINE 的全部价值建立在三条铁律上——它们让结论可被法务、可被竞品、可被你自己反复核对。

01

确定性规则,不是 AI 打分

五维里有四维是纯代码规则:字符串匹配、位置三分位、来源域名匹配,零大模型(不调用大语言模型打分)、零随机。同一份证据,永远得到同一个结论

02

原始计数,对外不报百分比

“5 次里被提到 0 次”,而不是“0%”。「小样本的百分比是噪声、经不起追问,我们只给原始计数配上威尔逊(Wilson)95% 置信区间」。

03

可溯源到每一次回答

取证按日期 append-only(只增不改)落盘、可断点续跑、不覆盖。报告里每个数字都用溯源标记 data-ev锚回那一次真实回答的截图——点开就能看“为什么是这个数”。

「在优化手段大多无效、效果还会随时间和竞争漂移的市场里,唯一稳定的价值,是可信的测量。」

我们测什么

每一次 AI 回答,拆成五个维度

问一个问题、连发追问、跑满 5 次,然后把每条回答拆成五维。「四维由规则自动确定,唯一的情感框架强制人工复核到最高置信层级(L1)才进报告」。

  1. 1

    提及 Mention

    品牌(及全部别名)有没有被写进答案正文?精确匹配,是/否。

  2. 2

    排位 / 首屏 Rank

    若被列出,排第几?是否落在前 600 字的首屏?按序数与字符位置定档。

  3. 3

    被引用为来源 Citation

    品牌有没有出现在 AI 的来源/参考列表里?按网址(URL)、标题、平台名匹配。

  4. 4

    情感框架 Sentiment

    “不可或缺”还是“最后选项”?唯一非自动维度,强制人工复核,宁漏勿冤。

  5. 5

    来源平台 Sources

    AI 这次的引用来自哪类平台?门户 / 垂直 / 百科 / 社媒 / 用户内容(UGC),决定优化杠杆。

四个子系统

从一句回答,到一份可分享的白皮书

四个互相独立的子系统,各自只产出纯数据、不掺观点;拼起来就是品牌在 AI 里的完整画像。

recall

召回主管线

用浏览器自动化工具 Playwright 驱动 6 个引擎网页端真实取证 → 五维评分 → 召回聚合与声量份额(Share of Voice)。

问题集 → 证据批次 → 白皮书
diagnostic

官网体检

单域名静态信号体检:robots.txt(爬虫规则)/ llms.txt(给 AI 看的说明)/ JSON-LD(结构化数据)/ 中文实体,三层加权 0–100 分,外加智能体(agent)可达性 L0–L3。

域名 → 评分卡 + 数据(JSON)
weights

引用来源权重

聚合证据,算出“这个引擎到底偏爱引用哪类来源”的来源×引擎矩阵,指明内容该铺在哪。

证据 → 权重矩阵
benchmark

引擎行为基准

品牌无关(brand-agnostic)的标准题集,测各引擎的应答率 / 带引用率 / 来源多样性,全部带威尔逊(Wilson)置信区间。

题集 → 行业基准

怎么合作

测量 → 诊断 → 建设 → 运营

基线测量可以单独买,作为一次诚实的体检;后面三步是把“被看见”做成可持续的资产与运营。

  1. 测量

    基线测量

    你现在在 AI 答案里的什么位置?一次健康检查,单独成立。

    产出 GEO 基线报告
  2. 诊断

    差距诊断

    为什么不被提及 / 不被引用 / 被说错?逐项归因到可修的差距。

    产出 差距清单 + 优先级
  3. 建设

    资产建设

    把品牌事实翻译成 AI 读得懂的来源:事实底稿、知识库、官网修复、内容。

    产出 事实底稿 / 知识库 / 修复项
  4. 运营

    持续运营

    按月复测、归因、更新知识库——因为 AI 的答案会随时间和竞争漂移。

    产出 月度报告 + 行动项

站在文献的肩膀上

每一个权重,都有出处

我们的评分常数不是拍脑袋。五维框架、三层权重、新鲜度高权、结构信号——逐项锚定公开研究,代码里凡引用文献都写明论文预印本平台 arXiv 的编号,凡是行业说法都显式标注“假设非真理”。

读完整方法论 →
+33–41%
加入统计数字带来的引用率提升
GEO 奠基论文 · 数据挖掘顶会 KDD 2024 ↗
+22% vs −9%
结构化改造 对比 纯正文改写
SAGEO Arena · arXiv 预印本 ↗
45 / 30 / 25
官网体检三层权重(基础 / 结构化 / 内容)
C-SEO Bench · 机器学习顶会 NeurIPS 2025 ↗

战略技术伙伴

BASELINE × 腾讯

我们与腾讯保持深度技术合作——从 GEO(生成式引擎优化)专家支持,到基准测试平台的底层技术。

GEO 技术专家支持

腾讯为我们提供 GEO 领域的技术专家支持,参与方法与口径打磨。

基准平台技术支持

引擎行为基准测试平台的底层技术,有腾讯技术团队参与。

BASELINE 自主研发

评估体系与产品由 BASELINE 自研;腾讯作为深度技术伙伴提供支持。

了解合作详情 →

常见问题

你大概想问

什么是 GEO(生成式引擎优化)?

GEO(生成式引擎优化,英文 Generative Engine Optimization)是让品牌在 AI 引擎的“生成式回答”里被准确提及、被引用、被排在前面的系统性工作。它和搜索引擎优化(SEO)的根本区别在于:搜索引擎优化争的是十条蓝色链接里的排名,GEO 争的是那一段由 AI 直接写出来的答案——用户往往看完答案就做了决定,不再点进任何网站。

GEO 和 SEO、AEO 是什么关系?

搜索引擎优化(SEO)优化的是搜索结果页排名;答案引擎优化(AEO)和 GEO 高度重叠,都关注“直接答案”。BASELINE 用 GEO 这个词,强调对象是生成式 AI 引擎(DeepSeek、豆包等)里那段被生成出来的回答,以及它引用了谁的来源。三者不互斥:一个 AI 友好的官网,通常搜索引擎优化也不差。

BASELINE 具体测哪些 AI 引擎?

必测 6 个中文消费级 AI 引擎:DeepSeek、豆包、通义、元宝、Kimi、文心。取证走网页端真实交互(用浏览器自动化工具 Playwright 驱动),尽可能贴近一个真实用户得到的回答,而不是调用对外接口(API)的“理想答案”。

为什么对外只报“5 次中 0 次”,不报百分比?

因为小样本的百分比是噪声。样本量 N=5(只测 5 次)时,“0%”和“20%”只差一次回答,却给人完全不同的印象,经不起法务或竞品的追问。我们只出原始计数「X 次中 Y 次」,并配威尔逊(Wilson)95% 置信区间,把不确定度老老实实标出来。这是诚实,也是自我保护。

查看全部常见问题 →

先知道自己在哪,再谈怎么赢

给我们一个品牌、几个真实问法。两周内,你会拿到一份能发给老板、也能发给法务的 AI 可见度基线。