先给结论:仅凭“咨询次数”不能推出“咨询人数”。你要做的是把每一次咨询记录先归到某个可识别的用户标识上,再分别统计“去重后的人数”和“未去重的次数”。如果标识缺失或不可靠,就只能给出区间,而不是一个确定值。下面以你手上的一份咨询明细表为例,说明怎么把它变成可执行的处理方案。
打开咨询记录,逐列检查是否存在以下字段:稳定用户标识(登录账号、设备标识、加密后的手机号或邮箱)、会话开始时间、会话结束时间、渠道来源、咨询主题。关键在于标识是否跨会话稳定。如果同一个人的两次咨询落在两条记录里,但标识字段一次为空、一次有值,那么这两条就无法可靠合并。
常见的三种数据质量状态,决定了你后续能做什么:
先做这一步判断,再决定要不要继续往下算。如果标识属于第二或第三种状态,直接进入后文的“近似归并”路径,不要假装能算准人数。
“次数”本身也需要定义,否则同一份数据能算出不同结果。常见口径有两种:
选择哪一种取决于你要回答的问题。如果你关心的是“服务承接压力”,按会话计次更贴近实际工作量;如果你关心的是“有多少个不同诉求”,按主题计次更合适。把口径写进统计说明,否则同一批数据在两次汇报里会对不上。
实际操作上,先按用户标识分组,再在组内按时间排序,用静默时长切分会话。切完后你会得到一张“用户—会话”表,每一行代表一次咨询,同时保留它属于哪个用户。这一步做完,人数就是用户标识的去重计数,次数就是行数。
假设你手上只有时间戳、渠道和咨询内容,没有稳定标识。此时不要直接按“内容相同就合并”,因为不同用户可能问同一类问题。更稳妥的做法是组合多个弱证据,并明确假设。
一个可执行的短例子(以下为假设数据,仅用于说明方法):
如果假设“同一用户在 10 分钟内、同一渠道、内容高度重叠”更可能是同一人,那么 A 与 B 可以合并为一人两次,C 因渠道不同暂不合并。这个判断依赖假设,所以你必须把假设写清楚,并说明换一个时间窗口或渠道条件,结果会变。这样得出的“人数”是一个区间,而不是精确值。
动作与结果的关系在这里很直接:你调整静默时长或相似度阈值,归并结果就会变;因此下一步不是继续算,而是先固定一套规则并记录它,再让后续统计沿用同一套规则。
回到你手上的那份表,按以下顺序操作:
这样处理之后,你得到的不是一个人数,而是一组带条件和置信说明的结果。后续无论是排班、回访还是内容优化,都能据此判断该按次数准备资源,还是按人数准备资源。第三方估算流量、搜索引擎报告与站内统计的口径本来就不一致,咨询数据同样如此,先把口径对齐再谈结论。
如果你发现去重后的人数远小于次数,说明存在高频重复咨询,下一步应优先检查自助解答或首次响应是否到位;如果两者接近,说明多数用户只问一次,重点应放在首次承接质量上。这个判断只在标识质量达到“稳定”等级时才成立,标识不可靠时请回到近似归并路径,不要直接下结论。