先别急着推翻分组结论,查分母要按“总体分母是否等于各分组分母之和”来核对。百度指数反映的是搜索关注度,它的总体值并不等于各关键词、各城市或各终端分组的简单加总;一旦你用的分母是站内访问量、表单量或订单量,这类可加总指标反而要求分组之和与总体严格对齐。因此第一步是确认指标类型:可加总指标查算术一致性,不可加总指标查口径定义是否一致。
百度指数的绝对值经过指数化处理,不同词、不同地域的量级不能直接相加还原真实搜索量。如果你把“品牌词+品类词”的分组指数相加,再与总体指数比较,得到的差异既可能来自指数化算法,也可能来自分组边界遗漏,不能直接判定总体或分组哪一个错了。相反,站内搜索次数、落地页访问量这类计数指标,分组之和与总体之差超过可解释范围,就说明存在未归类流量、重复计数或过滤规则不一致。
这一步的产出不是结论,而是一张“分母对照表”:总体分母是多少、各分组分母分别是多少、差额是多少、差额能否被已知的未归类项解释。只有差额被解释清楚,才进入下一步。
假设一个场景:某品类总体转化率环比上升,但按新老客分组后,两组转化率都下降。这种辛普森式反转,往往不是数据错了,而是分组结构变了——新客占比大幅提高,而新客本身转化率低,拉低了分组表现,却因为新客分母扩大让总体看起来变好。此时查分母的重点是:总体分母里是否包含无法归入任何分组的流量,比如直接访问、站外跳转、未登录用户。这些流量如果只计入总体、不计入分组,分组之和就永远对不上总体。
可执行动作:导出同一时间段的总体与分组明细,按“已归类/未归类”两列拆分。如果未归类占比超过你预设的容忍线,先补齐归类规则再重算,而不是先解释反转。补齐后如果反转消失,说明原结论是分母口径造成的;如果反转仍在,才需要检查分组内部是否还有更细的结构变化。
信分组的前提是:分组维度与业务决策直接相关,且分组分母完整、互斥、可加总。例如按投放渠道分组时,每个渠道的访问量都能独立追踪,分组之和等于总体,此时分组结论更贴近可操作对象。信总体的前提是:分组只是为了观察,而实际决策作用于整体,且分组之间存在明显结构差异。例如整体预算分配,就不应只看某一分组的高转化率而忽略它只占很小分母。
判断依据可以落成一句话:如果分组之和无法还原总体,先修分母;如果分组之和能还原总体但结论相反,先看结构权重。结构权重指的是各分组在总体分母中的占比变化。占比变化本身不是原因,但它能解释为什么相同分组表现会推出不同总体结论。
第三步的结果会直接影响下一步:若限制成立,后续优化任务应改为先补埋点或归类规则,而不是继续争论哪个结论正确。这一步的动作和结果,正是把角色分歧转成可核对项目的关键。
有些反转不是未归类项造成的,而是分组本身不互斥。比如同一用户既算新客又算老客,或同一订单被两个渠道同时归因,分组分母就会重复计算。此时分组之和大于总体,差额方向与未归类项相反。另一种例外是分组边界随时间变化,比如地域定义中途调整,导致前后两段的分组不可比。遇到这两种情况,先固定分组规则再重算,不要用单次差额下结论。百度指数分析中,地域和词包的分组边界同样需要固定,否则不同人拉取的“同一分组”可能根本不是同一分母。