先给结论:把“咨询次数”直接当成“咨询人数”,是同一用户反复咨询场景里最常见的口径错误。要区分两者,关键不是换一个统计工具,而是先确定“同一个人”用什么字段来识别,再决定去重发生在哪一步。如果身份字段稳定且覆盖率高,就去重成人数;如果身份字段缺失严重,就保留次数,但必须把“次数”明确写成互动量,而不是潜在客户数。
区分人数与次数的前提,是存在一个能把多条咨询记录串到同一个人身上的字段。常见候选包括手机号、会员ID、留资表单里的邮箱、平台账号ID。判断能不能用,看两点:一是稳定性,同一人在不同时间、不同入口是否留下同一个值;二是覆盖率,有多大比例的咨询记录带有这个值。
可以按下面两种条件做不同选择:
这里有一个容易被忽略的例外:同一个人可能用不同手机号或不同账号咨询,也会出现多人共用一台设备、一个账号的情况。任何单一字段都无法保证百分之百准确,所以去重结果应当被当作“可核对的口径”,而不是绝对事实。
多个角色对同一事实理解不同,往往不是因为谁算错了,而是各自看到了不同的口径。销售看到的是自己接待的对话条数,运营看到的是表单提交量,客服看到的是会话数。要化解分歧,先把争议拆成可以逐条核对的字段,而不是争论“到底有多少人”。
一个实际动作是:抽取同一时间段内的一批咨询记录,列出时间、入口来源、身份字段值、咨询内容摘要四列,让各方在同一张表上指认自己统计的是哪一列。这个动作的结果会直接决定下一步——如果各方指向的是同一列却得出不同数字,问题出在导出范围或时间边界;如果指向的是不同列,问题出在口径定义,需要先统一定义再谈数字。
假设示例:某段时间内系统记录咨询互动 100 次,其中 60 条带有可识别的手机号,这 60 条去重后对应 40 个人。此时可以说“可识别范围内为 40 人、100 次互动”,但不能说“共有 40 人咨询”,因为剩余 40 次互动是否属于这 40 人无法确认。这个例子只用于说明比较方法,数字本身不代表任何真实项目结果。
同样一份数据,去重放在不同环节,得到的数字并不相同。放在原始记录层去重,得到的是“有多少个不同的人咨询过”;放在转化层去重,得到的是“有多少个不同的人最终转化”。两者不能混用,否则会把咨询人数和成交人数搅在一起。
建议按分析目的选择:
需要说明的例外是:如果业务本身以“每次咨询”为计费或考核单位,那么次数才是主口径,去重人数只作为参考。口径选择应服务于决策用途,而不是追求唯一正确答案。
去重之后人数下降、次数不变,这本身不能证明处理是对的。人数下降也可能来自身份字段覆盖率变化、导出时间范围调整、入口来源增减。反过来,某个字段的填充率突然归零,也不能直接说明用户不再留下信息,还可能是表单改动、渠道结构变化或采集环节中断。
要形成可核对的证据链,至少同时看三样东西:身份字段的覆盖率随时间的变化、咨询记录的入口来源分布、以及同一字段在其它环节(如订单或会员系统)能否对应上。只有这些证据相互印证时,才能对人数与次数的差异给出较可靠的解释。
因此,下一次遇到“同一用户多次咨询”的争议时,先确认身份字段能否支撑去重,再决定是输出人数还是次数,并把选择依据写进报表说明。这样得到的数字未必更漂亮,但至少每个角色都能沿着同一张表核对到同一条记录。