recall 召回主管线
用浏览器自动化工具 Playwright 驱动 6 个必测引擎的网页端真实取证,逐条五维评分,聚合出召回率与声量份额。
- 必测 6 引擎:DeepSeek、豆包、通义、元宝、Kimi、文心。
- 串行取证、断点续跑、多账号容灾,触发风控自动换号或跳引擎。
- 支持“首问 + ≤2 追问”的思维链多轮,复刻真实用户问法。
- 深度思考双档(普通 / 深思)分别取证,对比同一问题的两种回答。
产品
四个互相独立、各自只产出纯数据的子系统;一条把“被看见”做成长期资产的合作路径。
recall 用浏览器自动化工具 Playwright 驱动 6 个必测引擎的网页端真实取证,逐条五维评分,聚合出召回率与声量份额。
diagnostic 单域名静态信号体检,三层加权 0–100 分,外加并列的智能体(agent)可达性 L0–L3 与内容伪装(cloaking)交叉验证。
weights 聚合已有证据,算出每个引擎偏爱引用哪类来源的来源×引擎矩阵,把“内容该铺在哪”变成数据。
benchmark 品牌无关(brand-agnostic)的标准题集,测各引擎的应答率、带引用率、来源多样性,全部带威尔逊(Wilson)置信区间。
基线测量单独成立;后三步把“被看见”做成可持续的资产与运营。
你现在在 AI 答案里的什么位置?一次健康检查,单独成立。
为什么不被提及 / 不被引用 / 被说错?逐项归因到可修的差距。
把品牌事实翻译成 AI 读得懂的来源:事实底稿、知识库、官网修复、内容。
按月复测、归因、更新知识库——因为 AI 的答案会随时间和竞争漂移。
| 典型 GEO 服务 | BASELINE | |
|---|---|---|
| 核心交付 | 优化承诺 / 关键词清单 | 可溯源的测量 + 优先级 |
| 评分方式 | 黑箱 / 主观 / 大模型打分 | 确定性规则,四维零大模型 |
| 对外口径 | 百分比、好看的曲线 | 原始计数「X 次中 Y 次」+ 威尔逊区间 |
| 证据 | 截图幻灯片(PPT),难复核 | append-only(只增不改)批次,逐数字可溯源 |
| 复测 | 一次性 | 跨批次比对(diff),按月运营 |
| 权重依据 | 经验 / 玄学 | 公开论文锚定,标注假设 |