1. 先搞清楚"验比例"到底在验什么
"AI初筛和人工深聊的比例"这个问题,十个团队里有八个是拍脑袋定的。老板说"AI先过一遍,能省不少人力",于是运营随手定了个"AI筛70%,人工聊30%",跑了两周发现转化掉了一半,又慌忙调回50/50,来回折腾。问题不在于比例本身,而在于大多数人根本没想清楚:这个比例到底在优化什么指标?
我先把话说透:AI初筛和人工深聊的比例,本质上是一个"资源分配问题",不是一个"技术参数问题"。你手里的资源是有限的——人工深聊的产能(一个销售一天能聊多少个)、AI初筛的准确率(误杀率和漏放率)、以及最关键的转化漏斗数据。比例是这三者博弈出来的结果,不是拍出来的。
所以"验比例"这件事,验的不是"70%好还是50%好",而是验三个东西:
- AI初筛的判定质量:它把"值得深聊的人"筛出来了吗?误杀了多少?漏放了多少?
- 人工深聊的边际产出:多聊一个人,能多转化多少?这个边际收益是递增还是递减?
- 整体漏斗的效率拐点:在哪个比例上,单位人力投入带来的转化最高?
这三个问题不回答,你调比例就是盲调。下面我按实操顺序,把这套验证方法拆开讲。
1.1 为什么"意向分层"是绕不开的前置动作
在聊比例之前,必须先做意向分层。这是很多人跳过的一步,也是比例怎么调都调不对的根因。
什么叫意向分层?简单说,就是把所有进来的线索按"购买意向强度"分成几档。比如:
| 分层 | 特征描述 | 典型占比 |
|---|---|---|
| A层(高意向) | 主动询价、问细节、问交付时间 | 10%-15% |
| B层(中意向) | 有需求但还在比价、观望 | 25%-35% |
| C层(低意向) | 只是随便看看、留资凑热闹 | 40%-50% |
| D层(无效) | 明显是垃圾线索、同行、误触 | 10%-20% |
为什么要先分层?因为AI初筛和人工深聊的比例,在不同层级上应该是完全不同的。A层线索你让AI筛完再人工聊,纯属浪费——这种线索直接人工上,转化率最高。D层线索你让AI筛完直接丢,人工碰都不该碰。真正需要"AI初筛+人工深聊"组合拳的,是B层和C层。
我见过一个团队,所有线索不分层,统一按"AI筛60%、人工聊40%"跑,结果A层高意向客户被AI的机械话术晾了半小时,转头去了竞品;D层垃圾线索占了人工大量时间。比例看着"科学",实际全是内耗。
提示:意向分层的标准不要拍脑袋定,用历史成交数据反推。把过去三个月的成交客户拉出来,看他们成交前的行为特征(问了几个问题、停留时长、是否主动留电话),这些特征就是分层的依据。
1.2 比例验证的核心指标:不是转化率,是"单位人力产出"
很多人验比例只看总转化率,这是错的。总转化率会骗人——你把人工深聊比例拉到100%,转化率肯定高,但人力成本也爆炸了。
正确的核心指标是单位人力产出,我通常用这个公式:
单位人力产出 = 总转化数 / 人工深聊总工时或者更细一点:
单位人力产出 = (AI筛出并转人工的转化数 + AI直接转化的转化数) / 人工投入工时这个指标的意义在于:它衡量的是"你每投入一小时人工,能换来多少转化"。比例调整的目标,是让这个值最大化,而不是让总转化率最大化。
举个例子。假设你有1000条线索:
- 方案A:AI筛70%,人工聊300条,转化30单,人工工时150小时 → 单位产出0.2单/小时
- 方案B:AI筛50%,人工聊500条,转化38单,人工工时250小时 → 单位产出0.152单/小时
方案B总转化更高(38>30),但方案A的单位人力产出更高。如果你的目标是"用有限人力撬动最大产出",方案A更优;如果人力充裕、只追求绝对转化量,方案B更优。没有绝对的对错,只有匹配你当前资源状况的选择。
这就是为什么我说"验比例"要先明确优化目标。目标不清,数据再多也是白搭。
2. 搭建可验证的实验框架:别用"感觉"代替"数据"
拍脑袋定比例的人,最大的问题是没有对照组。他们调了比例,看到转化涨了,就以为调对了——但可能只是那段时间流量质量好,或者季节因素。要真正验证比例,必须搭一个能排除干扰的实验框架。
2.1 最小可行实验:A/B分流怎么设计
最直接的方法就是A/B测试。但线索分流的A/B测试有个坑:你不能简单地把线索随机分成两组,因为线索质量本身波动很大。今天来的线索和明天的可能完全不同。
我的做法是同期分流+分层内随机:
- 先把当天所有线索按意向分层(A/B/C/D)
- 在每一层内部,随机把线索分成实验组和对照组
- 实验组用新比例(比如AI筛70%),对照组用旧比例(比如AI筛50%)
- 跑够样本量后对比两组的单位人力产出
这样设计的好处是:同一时间段、同一批流量质量,唯一变量就是比例。排除掉了时间、季节、流量波动的干扰。
样本量要多少?粗略估算,每组至少需要200-300条有效线索,跑1-2周,数据才有统计意义。样本太小,随机波动就能让你的结论完全反过来。
注意:分流的时候要确保AI初筛的模型版本一致。如果实验组用了新模型、对照组用旧模型,那你验的就不是"比例",而是"模型+比例"的混合变量,结论没法归因。
2.2 记录哪些字段才能事后复盘
实验跑起来只是第一步,记录字段的设计决定了你能不能复盘。我建议至少记录以下字段,缺一个都可能导致复盘时抓瞎:
| 字段 | 说明 | 用途 |
|---|---|---|
| 线索ID | 唯一标识 | 关联追踪 |
| 进入时间 | 精确到小时 | 分析时段效应 |
| 意向分层 | A/B/C/D | 分层分析 |
| 分流组别 | 实验组/对照组 | 对比基础 |
| AI初筛结果 | 通过/拦截/转人工 | 验证AI判定 |
| AI初筛理由 | 命中了哪些规则/特征 | 分析误判原因 |
| 是否人工深聊 | 是/否 | 计算人工覆盖率 |
| 人工深聊时长 | 分钟 | 计算人力成本 |
| 最终结果 | 成交/流失/待跟进 | 计算转化 |
| 流失原因 | 分类标签 | 归因分析 |
这里我要特别强调**"AI初筛理由"**这个字段。很多人不记录这个,导致AI误杀的时候根本不知道为什么。比如AI把一个大客户拦了,你事后想复盘,发现只记录了"拦截"两个字,完全不知道它命中了什么规则。记录理由,才能定位是规则问题还是模型问题。
2.3 一个容易被忽略的变量:人工深聊的"质量波动"
实验设计里有个隐藏变量,很多人没意识到:人工深聊的质量本身是波动的。同一个销售,上午状态好和下午状态差,转化率能差一倍。不同销售之间差距更大。
如果你实验组和对照组分配到的销售水平不一样,那结论就不可信。解决办法有两个:
- 同一批销售轮流处理两组线索:让每个销售既聊实验组也聊对照组,把销售个体差异平均掉
- 记录销售ID,事后做协变量分析:如果没法轮流,至少在复盘时把销售因素作为控制变量
我吃过这个亏。有一次实验组转化明显高,我以为是比例调对了,结果一查,实验组的线索恰好分给了团队里最强的那个销售。白高兴一场。
3. 从数据里读出"拐点":比例不是线性的
跑完实验拿到数据,接下来是最关键的一步:找拐点。很多人以为"AI筛得越多,人力越省,但转化越低",是一条平滑的直线。实际上不是,它是一条有拐点的曲线。
3.1 边际收益递减:为什么70%之后就不划算了
先理解一个概念:边际收益递减。
当AI初筛比例从0%提到30%时,你省下的人力是巨大的,而损失的转化很小——因为被AI筛掉的那部分,本来就是低意向的C/D层,人工聊也是浪费时间。这个阶段,单位人力产出是上升的。
当比例从30%提到60%时,你开始筛掉一些B层线索。这些线索人工聊是有机会转化的,被AI筛掉就损失了。但省下的人力还能覆盖这个损失,单位产出可能还在微升或持平。
当比例从60%提到80%时,你开始大量误杀B层甚至A层线索。省下的人力已经不足以弥补转化损失,单位产出开始下降。
拐点就在"单位人力产出由升转降"的那个比例上。这个点通常在50%-70%之间,但具体在哪,取决于你的AI准确率和人工效率。
我做过的一个项目,拐点在58%左右。低于58%,加AI比例还能提升单位产出;高于58%,每加一个点都在亏。这个数字不是拍出来的,是跑了两周实验、画了几十条数据点拟合出来的。
3.2 用"误杀成本"反推最优比例
除了看拐点,还有一个更实操的方法:算误杀成本。
误杀成本 = 被AI错误拦截的线索数 × 这类线索的人工转化率 × 单客价值
假设你的AI初筛误杀率是5%(即100条该通过的线索,它拦了5条),被误杀的线索里,人工能转化的比例是20%,单客价值1000元。那么每100条线索的误杀成本是:
5条 × 20% × 1000元 = 1000元而AI初筛省下的人力成本,假设每条线索人工深聊成本是5元,AI筛掉100条省500元。
这时候你就发现:误杀成本(1000元)> 省下的人力成本(500元),说明当前AI比例过高了,应该降低。
反过来,如果误杀成本低于省下的人力成本,就可以继续提高AI比例。
这个方法的好处是:它把"比例"翻译成了"钱",老板和运营都能听懂。你不用跟他们解释什么拐点、边际收益,直接说"现在每提高10%的AI比例,净亏2000块",决策就清晰了。
3.3 分层定比例:A层和C层不该用同一个数
前面反复强调意向分层,这里落到比例上:不同层级的最优比例完全不同。
| 分层 | 建议AI初筛比例 | 理由 |
|---|---|---|
| A层 | 0%-20% | 高意向,人工直接上,AI只做基础信息补全 |
| B层 | 40%-60% | 核心战场,AI筛掉明显不匹配的,人工聊剩下的 |
| C层 | 70%-90% | 低意向,AI大量筛,人工只碰AI判定有潜力的 |
| D层 | 100% | 直接AI拦截,人工零投入 |
这样分层定比例,整体单位人力产出能比"一刀切"高出30%以上。因为每一层都用在了它最该用的地方。
我见过最极端的案例:一个团队把A层线索也丢给AI初筛,结果AI用标准话术问"请问您有什么需求",高意向客户直接回"我都问了三遍了",体验极差。A层线索的正确做法是跳过初筛,直接转人工,AI最多做个信息摘要辅助销售。
4. 实操中那些"数据不会告诉你"的坑
实验框架搭好了,数据也跑了,但实操中还有一堆坑,是数据本身反映不出来的。这部分是我踩过的血泪教训,分享出来帮你少走弯路。
4.1 AI初筛的"假通过":它说通过,不代表值得聊
AI初筛有个隐蔽的问题:假通过。就是AI判定"这条线索可以转人工",但实际上这条线索质量很差,人工聊了也是白聊。
为什么会有假通过?因为AI的判定逻辑通常是"排除明显无效的",而不是"识别真正优质的"。它只要没发现明显的垃圾特征,就放行。结果就是大量"不好不坏"的线索涌向人工,把人工产能占满了。
这个问题在数据上表现为:AI初筛通过率很高,但人工深聊的转化率很低。如果你只看"AI通过率"这个指标,会觉得AI工作得很好;但一看人工转化率,就露馅了。
解决办法是给AI初筛加一个**"优先级排序"**,而不只是"通过/拦截"二分类。让AI对通过的线索按质量打分,人工优先聊高分的那批。这样即使通过率不变,人工的效率也能提升。
4.2 人工深聊的"假努力":聊了不等于聊到位
另一个坑在人工这边。有些销售为了凑"深聊量",把每条线索都聊够时长,但实际没聊到点子上。数据上"人工深聊覆盖率"很漂亮,转化却没涨。
这个坑的根因是考核指标错了。如果你考核销售的"深聊数量",他就会刷数量;如果你考核"转化数",他才会有质量地聊。所以在验证比例的时候,人工这边的考核指标一定要和"转化"挂钩,而不是和"聊了多少"挂钩。
我在一个项目里做过对比:同样的人工深聊比例,A组销售考核"深聊量",B组考核"转化数"。结果B组的单位人力产出是A组的1.8倍。比例一样,结果差这么多,问题就出在人的行为上。
4.3 别在"流量质量波动期"做实验
这条是实验设计的时间选择问题。不要在流量质量剧烈波动的时期做比例实验。比如大促前后、节假日、竞品搞活动的时期,线索质量本身就在大幅波动,你这时候调比例,根本分不清是比例的效果还是流量的效果。
我一般建议选流量平稳期做实验,至少连续跑两周,中间不要有大活动干扰。如果实在避不开,就在分析时把"日期"作为控制变量,看比例在每一天内的效果是否一致。
4.4 AI和人工的"交接损耗":被忽略的隐形漏斗
还有一个特别容易被忽略的点:AI转人工的交接环节。AI筛完线索,转给人工,这个交接如果做得不好,会漏掉大量线索。
常见的交接损耗有:
- AI转人工后,线索在系统里排队,销售没及时看到,客户等太久流失
- AI给人工的线索信息不完整,销售要重新问一遍,客户体验差
- AI和人工的话术风格不一致,客户感觉"换了个人",信任感断裂
这些损耗在数据上不会直接体现为"比例问题",但会严重影响整体转化。所以在验证比例的同时,一定要检查交接环节的顺畅度。我通常会把"AI转人工后的首次响应时间"作为一个监控指标,超过5分钟就要预警。
5. 一套可复用的验证流程:从拍脑袋到有据可依
把前面所有内容串起来,我给一套完整的、可以直接抄的验证流程。这套流程我在三个不同项目里跑过,都能把"比例"从玄学变成可量化的决策。
5.1 第一步:定义你的"单位人力产出"公式
先明确你的优化目标。是"单位人力产出最大",还是"总转化最大",还是"人力成本最低"?不同目标对应不同的比例。
我一般推荐用单位人力产出,因为它平衡了产出和成本。公式前面给过了,这里再强调一次:分母是"人工深聊总工时",不是"人工深聊线索数"。因为不同线索聊的时长不一样,用工时更准。
5.2 第二步:分层,然后给每层设一个初始比例
按意向分成A/B/C/D四层,每层给一个初始比例(参考3.3节的表格)。这个初始比例不用很准,它只是实验的起点。
5.3 第三步:同期分流实验,跑够样本
在每层内部随机分流,实验组用新比例,对照组用旧比例。跑1-2周,每组至少200条线索。记录2.2节列的所有字段。
5.4 第四步:算每层的单位人力产出,找拐点
对每一层,画出"AI比例 vs 单位人力产出"的曲线,找到拐点。如果数据点不够,至少对比3-4个不同的比例档位(比如40%、50%、60%、70%)。
5.5 第五步:算误杀成本,交叉验证
用3.2节的公式算误杀成本,和拐点结论交叉验证。如果两个方法结论一致,就可以确定最优比例;如果不一致,说明还有隐藏变量,需要进一步排查。
5.6 第六步:小流量灰度上线,持续监控
确定比例后,不要一次性全量切换。先拿10%-20%的流量灰度跑一周,确认没有异常,再逐步放量。上线后持续监控"单位人力产出"和"误杀成本",一旦发现偏离,及时回调。
提示:比例不是定一次就完事的。AI模型会更新、人工团队会换人、市场环境会变,最优比例也会漂移。我建议每季度重新跑一次验证,至少做一次小规模的A/B测试,确保比例还在最优区间。
6. 关于"人机比例"这件事,我最后想说的
做了这么多项目,我最大的体会是:AI初筛和人工深聊的比例,从来不是一个"技术问题",而是一个"业务理解问题"。你对业务理解得越深,对客户分层越细,对转化漏斗越清楚,这个比例就越容易定。
反过来,如果你连"什么样的线索值得聊"都说不清楚,那再多的实验数据也帮不了你。因为实验只能告诉你"哪个比例产出高",但告诉不了你"为什么",更告诉不了你"怎么优化AI让它筛得更准"。
所以我的建议是:先把意向分层做扎实,把转化漏斗的每个环节数据打通,然后再谈比例。顺序反了,就是白费功夫。
另外,别迷信"最优比例"这个概念。真实业务里,比例在一个区间内波动都是正常的。你要做的是确保它不偏离最优区间太远,而不是追求一个精确到小数点的数字。我见过太多团队为了"把比例从58%调到57.5%"折腾半天,结果收益还不如把AI的误杀率降一个点。
最后分享一个我常用的判断标准:如果你调整比例后,单位人力产出的变化在5%以内,那这个调整基本可以忽略,属于噪声范围。只有当变化超过10%,才值得认真对待。这个阈值帮我省了很多无谓的纠结。
比例是手段,不是目的。目的是让每一条线索都找到它最该去的地方——高意向的快速人工跟进,低意向的AI高效处理,中间的用组合拳。想清楚这个,比例自然就出来了。