为什么我们对外只报原始计数,不报百分比
样本只有 5 次时,「0%」和「20%」只差一次回答,却给人完全不同的印象。讲清楚我们为什么坚持用原始计数(写成「X 次中 Y 次」)加上一个置信区间。
打开任何一份 GEO(生成式引擎优化)报告,最常见的句子是「你在豆包上的可见度是 20%」。听起来很专业。问题是:这个数字背后,常常只有 5 次测量。
5 次里的百分比,是噪声
假设我们在一个引擎上、用同一组问法跑了 5 次,品牌被提到 1 次。报告写「20%」。但只要这 1 次变成 0 次,数字就从 20% 掉到 0%——一次回答的抖动,制造了一个看起来相差悬殊的百分比。
反过来也一样:5 次中 3 次写成「60%」,5 次中 4 次写成「80%」,中间只隔着一次回答。当样本只有个位数,百分比把测量误差包装成了确定结论。法务会戳穿它,竞品也会。
「小样本的百分比是噪声、经不起追问,我们只给原始计数配上一个置信区间。」
所以我们写「X 次中 Y 次」,并带上区间
我们对外只报原始计数:「5 次中 0 次」「40 次中 15 次」。它不掩盖样本量,读者一眼就知道这个结论有多重。
在原始计数之上,我们再给一个威尔逊(Wilson)95% 置信区间——一种闭式、确定性的区间算法(由统计学家 E.B. 威尔逊在 1927 年提出),在小样本下的覆盖率优于另一种常见算法「Wald 区间」,而且不需要像自助法(bootstrap,一种靠反复随机抽样估计的统计方法)那样引入随机过程。换句话说:同一份证据,谁来算,区间都一样。
这条纪律有学术研究撑腰(论文均可在预印本平台 arXiv 上查到):
- 《Don’t Measure Once(别只测一次)》(arXiv 2604.07585):单次测量不可信,二元结果(提到/没提到)必须带上不确定度。
- 《Quantifying Uncertainty in Answer Engine Visibility(量化答案引擎可见度的不确定性)》(arXiv 2603.08924):把不确定度量化,是做可见度研究的前提。
这不只是诚实,也是自我保护
把噪声写成百分比,短期好看,长期是定时炸弹:客户拿着「20% 涨到 35%」来问你做了什么,而真相可能只是抖动。我们宁可写「5 次中 1 次 → 5 次中 2 次(两个区间还重叠)」,让结论站得住。
测量的价值,恰恰在于它不替你夸大。一份不会在追问下崩掉的报告,才值得拿去做决策。