客户系统用久了,重复资料几乎是必然出现的:同一个客户,广告进来一次、活动留档一次、老销售手里又有一份,三个入口,三份记录。看着是小问题,真查数据、算归属、做回访的时候,重复资料就会让人头疼——同一个客户被当成两个人跟进,业绩算两遍,报表全是虚的。
合并重复资料,思路不复杂,坑却不少。这篇把查重、合并、留痕三个环节拆开讲,重点说说怎么不翻车。
一、重复是怎么来的
知道重复从哪来,才知道该在哪堵。常见的来源就几类:
多入口录入。线上表单、门店登记、销售手动添加,同一个客户从不同口子进来,系统只认"新增",不认"已存在"。
历史数据导入。老系统、旧表格搬到新系统时,格式不统一,同一个客户被导了两次,或者一个字段有出入就变成两条。
人为重复添加。销售记不住是不是已经建过档,手一抖又加了一条;两个人同时拿到同一批线索,各建各的。
这三类里,多入口和导入是重灾区。堵源头是一方面,另一方面得有一套"事后能收口"的合并机制。
二、查重:别只比姓名
查重的关键,是选对判定维度。拿姓名比,同名的人一大堆,误伤率高;只比手机号,号码录错一位就漏判。实际做法通常是组合判断:
强标识优先。手机号是个人客户里很可靠的主键,先把号码做归一化处理——去掉空格、横线,统一成纯数字,再比较。归一化之后,同一号码的两条记录基本可以认定是同一人。
组合兜底。没有手机号或者号码对不上的,用"姓名 + 其他字段"兜:姓名相同且公司或地区或来源一致的,判为疑似重复。
分层置信度。别搞一刀切。强匹配(手机号完全一致)可以直接进合并流程;弱匹配(姓名相同但其他字段有出入)要先进入"人工确认"队列,让人扫一眼再定。全自动合并弱匹配,是误合并的重灾区。
一句话:机器做"找出像的",人做"确认是不是"。比"全自动合并"和"全靠人肉翻"都稳。
三、合并:主记录怎么留,冲突怎么取舍
确认是重复之后,合并本身也有讲究,尤其两件事:哪条当主记录,字段冲突听谁的。
主记录选择。建议保留"档案更完整 + 更新时间更新"的那条做主体,另一条的资料并进来,而不是机械地保留先创建的。先建的不一定全,往往后录入的那条补充了更多信息。
字段冲突取舍。两条记录同一个字段不一样,比如一条备注"已报价",一条备注"客户在比价",不能简单地后写的覆盖先写的。稳妥做法:关键字段(来源、归属、跟进阶段)以主记录为准,差异较大的字段把两条都留进历史,人工看一眼再定;不要写"谁新就听谁的"这种粗暴规则,容易把有用的历史信息盖掉。
关联数据一起并。客户下面的跟进记录、订单、任务,要跟着主记录一起归拢,而不是留在被合并的那条上——不然合并完,客户是干净了,历史记录却丢在另一个看不见的角落里。
四、留痕:合并也要能回滚
合并是不可逆操作里比较容易出事的一种,所以它本身必须留痕、可回滚。
合并前留快照。被合并的两条记录,合并前的完整内容要存一份,出了争议能翻回原样。
记录合并日志。谁在什么时间合并的、哪两条并成了哪条、主记录按什么规则选的、有没有人工确认,写进日志。以后有人问"这个客户怎么变成这样了",能查得到来龙去脉。
能回滚。合并做完发现并错了(两条其实是两个人),能拆回去。技术上合并设计成"逻辑合并"会比"物理删除"安全得多——被合并的记录标记为归档,而不是真删,随时可以还原。
五、几个常见的坑
列几个实际容易踩的,供对照检查:
坑一:弱匹配也全自动合并。姓名相同的两个人被并成一条,客户资料互相污染,比重复更麻烦。
坑二:只并主表不并关联。客户合了,跟进记录还散在旧记录下,等于没并干净。
坑三:字段"以新覆盖旧"一刀切。把之前标注的关键信息盖没了,事后想找都找不到。
坑四:合并没有日志。出了问题不知道谁并的、为什么并,只能认栽。
写在后面
重复资料合并,做得好是让数据干净,做不好就是二次污染。原则不复杂:查重要分层、合并要留主、关联要跟走、操作要留痕——这四条守住,基本就不会翻车。
客户系统在实现上,像鲲极这类方案会把手机号归一化查重、疑似重复队列、合并留痕做成现成能力,合并前看一眼、合并后查得到,不用自己从零搭一套。
数据干净,很多问题就消了一半。重复资料这件小事,值得认真对待。