看不见,直到客户截图发来
搜索引擎你还能查排名;AI 的回答因人、因问法、因时间而变,你没有仪表盘——除非有人替你逐条实测。
为什么是现在
当用户不再翻十条蓝色链接、而是直接问 AI“找谁靠谱”,你的品牌要么被写进那段答案,要么根本不存在。这是一个全新的、你看不见的货架。
搜索引擎你还能查排名;AI 的回答因人、因问法、因时间而变,你没有仪表盘——除非有人替你逐条实测。
学术基准 C-SEO Bench(机器学习顶会 NeurIPS 2025)显示:「很多 GEO 优化手段在真实条件下并不稳定,效果会随模型迭代与竞争而漂移」。唯一稳定的价值,是可信的测量。
普华永道(PwC)的研究发现 AI 回答里链接有效率 >94%,但事实准确率只有 39–77%。AI 可能提到你,却把你说窄、说错、说成“备胎”。
我们的取向
我们不卖玄学。BASELINE 的全部价值建立在三条铁律上——它们让结论可被法务、可被竞品、可被你自己反复核对。
五维里有四维是纯代码规则:字符串匹配、位置三分位、来源域名匹配,零大模型(不调用大语言模型打分)、零随机。同一份证据,永远得到同一个结论。
“5 次里被提到 0 次”,而不是“0%”。「小样本的百分比是噪声、经不起追问,我们只给原始计数配上威尔逊(Wilson)95% 置信区间」。
取证按日期 append-only(只增不改)落盘、可断点续跑、不覆盖。报告里每个数字都用溯源标记 data-ev锚回那一次真实回答的截图——点开就能看“为什么是这个数”。
「在优化手段大多无效、效果还会随时间和竞争漂移的市场里,唯一稳定的价值,是可信的测量。」
我们测什么
问一个问题、连发追问、跑满 5 次,然后把每条回答拆成五维。「四维由规则自动确定,唯一的情感框架强制人工复核到最高置信层级(L1)才进报告」。
品牌(及全部别名)有没有被写进答案正文?精确匹配,是/否。
若被列出,排第几?是否落在前 600 字的首屏?按序数与字符位置定档。
品牌有没有出现在 AI 的来源/参考列表里?按网址(URL)、标题、平台名匹配。
“不可或缺”还是“最后选项”?唯一非自动维度,强制人工复核,宁漏勿冤。
AI 这次的引用来自哪类平台?门户 / 垂直 / 百科 / 社媒 / 用户内容(UGC),决定优化杠杆。
四个子系统
四个互相独立的子系统,各自只产出纯数据、不掺观点;拼起来就是品牌在 AI 里的完整画像。
recall 用浏览器自动化工具 Playwright 驱动 6 个引擎网页端真实取证 → 五维评分 → 召回聚合与声量份额(Share of Voice)。
diagnostic 单域名静态信号体检:robots.txt(爬虫规则)/ llms.txt(给 AI 看的说明)/ JSON-LD(结构化数据)/ 中文实体,三层加权 0–100 分,外加智能体(agent)可达性 L0–L3。
weights 聚合证据,算出“这个引擎到底偏爱引用哪类来源”的来源×引擎矩阵,指明内容该铺在哪。
benchmark 品牌无关(brand-agnostic)的标准题集,测各引擎的应答率 / 带引用率 / 来源多样性,全部带威尔逊(Wilson)置信区间。
怎么合作
基线测量可以单独买,作为一次诚实的体检;后面三步是把“被看见”做成可持续的资产与运营。
你现在在 AI 答案里的什么位置?一次健康检查,单独成立。
为什么不被提及 / 不被引用 / 被说错?逐项归因到可修的差距。
把品牌事实翻译成 AI 读得懂的来源:事实底稿、知识库、官网修复、内容。
按月复测、归因、更新知识库——因为 AI 的答案会随时间和竞争漂移。
战略技术伙伴
我们与腾讯保持深度技术合作——从 GEO(生成式引擎优化)专家支持,到基准测试平台的底层技术。
腾讯为我们提供 GEO 领域的技术专家支持,参与方法与口径打磨。
引擎行为基准测试平台的底层技术,有腾讯技术团队参与。
评估体系与产品由 BASELINE 自研;腾讯作为深度技术伙伴提供支持。
常见问题
GEO(生成式引擎优化,英文 Generative Engine Optimization)是让品牌在 AI 引擎的“生成式回答”里被准确提及、被引用、被排在前面的系统性工作。它和搜索引擎优化(SEO)的根本区别在于:搜索引擎优化争的是十条蓝色链接里的排名,GEO 争的是那一段由 AI 直接写出来的答案——用户往往看完答案就做了决定,不再点进任何网站。
搜索引擎优化(SEO)优化的是搜索结果页排名;答案引擎优化(AEO)和 GEO 高度重叠,都关注“直接答案”。BASELINE 用 GEO 这个词,强调对象是生成式 AI 引擎(DeepSeek、豆包等)里那段被生成出来的回答,以及它引用了谁的来源。三者不互斥:一个 AI 友好的官网,通常搜索引擎优化也不差。
必测 6 个中文消费级 AI 引擎:DeepSeek、豆包、通义、元宝、Kimi、文心。取证走网页端真实交互(用浏览器自动化工具 Playwright 驱动),尽可能贴近一个真实用户得到的回答,而不是调用对外接口(API)的“理想答案”。
因为小样本的百分比是噪声。样本量 N=5(只测 5 次)时,“0%”和“20%”只差一次回答,却给人完全不同的印象,经不起法务或竞品的追问。我们只出原始计数「X 次中 Y 次」,并配威尔逊(Wilson)95% 置信区间,把不确定度老老实实标出来。这是诚实,也是自我保护。