那天下午两点,系统弹出一条红色预警:某地一个固定电话号码段,30分钟内呼叫了800多次,平均通话时长只有4.7秒,回拨率几乎为零。网管侧同步显示,该号码集中的话务源端口长时间处于高并发状态,但从未办理过任何呼叫中心业务。直觉告诉我,这不是普通的骚扰电话,而是典型的设备化、批量化的涉诈呼叫。后来的现场排查证实了判断——藏在天花板吊顶里的那台巴掌大的设备,就是所谓VOIP黑盒。
这类设备近两年在涉诈案件中冒头很快。它不依赖SIM卡,不需要实名制开户,一台设备就能带几十路语音通道对外呼叫,配合改号功能冒充公检法、银行客服、电商售后,一天能打出上千通诈骗电话。中国联通反诈大模型的预警能力,恰恰是在这个环节发挥了关键作用:从海量话单中识别出这批“不像人打的”电话,先从号码层面锁定异常,再顺着话单一路溯源到具体端口、具体地址,最后协助公安机关现场缴获设备、打掉窝点。
这篇就把这套链路从头到尾拆开讲讲:黑盒是什么、为什么传统反诈手段拿它没辙、大模型靠什么把它揪出来,以及从预警到现场处置的完整流程和踩坑经验。对运营商运维、反诈一线人员和网络安全从业者来说,应该都有参考价值。
1. 涉诈VOIP黑盒设备到底是什么,为什么能绕过传统反诈体系
1.1 黑盒设备的真实形态:一块比路由器还小的板卡
先纠正一个刻板印象。很多人听到“VOIP黑盒设备”,脑子里浮现的是一大柜子服务器,实际上完全不是。这类设备本质上是一台多路语音网关,也叫IAD(Integrated Access Device)或语音网关,尺寸通常和家用路由器差不多,有一些甚至更小,只有巴掌大。
硬件上它就几个部件:一个WAN口接宽带或专线,一个LAN口用于远程管理,一到四个FXS口或者更高密度的语音模块,用于接入模拟话机或直接对接运营商语音线路。高配一点的型号支持8路、16路、32路并发语音通道,单台设备理论上可以支撑几十通电话同时呼叫。整机功耗很低,装在一个小铁盒或者塑料壳里,发热量也不大,这给它的隐蔽部署提供了硬件条件。
实际案件中,黑盒通常部署在这几个地方:写字楼的弱电井、出租屋的吊顶天花板、酒店楼层配电间的机柜背面、甚至快递柜旁边的电源箱里。因为体积小、无风扇噪音、功耗低,不刻意去查,日常巡检根本发现不了。公安机关在现场勘查时,经常是掀开吊顶板才看到设备和一堆网线、电源适配器缠在一起。
它的安装方式也很有特点。从运营商线路侧看,黑盒一般并联在宽带网络上,通过SIP协议注册到诈骗团伙自己架设的呼叫平台。也就是说,黑盒本身不独立发话,它只是把网络侧的SIP呼叫转换成传统语音呼叫,往运营商的话务网里灌。诈骗分子远程下发呼叫指令,黑盒在本地执行,将改号后的主叫号码送到被叫用户手机上。
1.2 诈骗团伙的组网逻辑:为什么箱子里没有SIM卡
传统“猫池”设备之所以好堵,是因为它插了一堆SIM卡,每张卡都有实名信息,运营商可以根据IMSI、ICCID、基站位置快速定位。VOIP黑盒的“高明”之处在于,它完全绕开了SIM卡体系。
黑盒用的是固定电话线路或基于宽带的语音通道,走的是SIP中继协议。对运营商网络来说,这些呼叫从合法接入的物理端口进来,来源是真实存在的宽带线路或固话端口。区别在于,号源是诈骗团伙通过改号网关伪造的,而传输通道是“正规军”的通道被“借道”了。
这个组网逻辑带来一个很头疼的问题:传统反诈拦截策略,比如对高风险号卡停机、对漫游异常号码限制呼出、对涉诈IMEI封禁,全部失效。因为黑盒根本不需要这些身份标识。它用的是宽带账号、固话端口这类资源,而这些资源在诈骗团伙手里往往是租来的、买来的、或者冒用他人身份开的,甚至有些是通过违规代理渠道办的“白名单”线路。
更麻烦的是组网灵活。一个诈骗窝点可能同时控制几十台黑盒,分散在不同城市、不同运营商线路下,每台设备只负责一小部分呼叫量,单台设备的日均话务量控制在看似正常企业的范围内。如果不做跨设备、跨区域的关联分析,单看一台设备的数据,很难判断它有问题。诈骗团伙还会周期性更换设备接入点,窝点一暴露,设备一地,远程重新注册到另一条线路上,几分钟就能恢复呼叫能力。
1.3 黑盒呼叫与传统诈骗电话的差异
从话单数据上看,黑盒呼叫和传统SIM卡诈骗电话有明显差异,这也是大模型能识别它的前提。
传统SIM卡诈骗电话有个典型特征:号码起呼量大,但受限于基站资源,同一时间只能在一两个基站覆盖范围内活动,位置更新频繁,漫游行为异常。而且SIM卡诈骗电话的生命周期很短,往往几小时到几天就被封停,诈骗团伙要不停换卡。
黑盒呼叫则表现出完全不同的画像:号码在连续多天内稳定输出话务,起呼时段集中在工作日上午和下午,凌晨基本休眠,作息规律得像一家正经公司。主叫号码会频繁轮换,但每个号码的呼叫行为高度一致——海量起呼、短通话、低回拨。被叫号码则极度分散,没有明显的号码段聚集,这说明犯罪分子在用号码池随机拨号或者根据黑灰产购买的公民信息定向拨号。
要特别注意的是,黑盒呼叫的接通率其实不低,有的窝点能做到10%以上,因为改号后显示的主叫是本地固话或官方热线号码,迷惑性很强。前几年多发的“冒充公检法”诈骗,很多就是这类设备打出来的。接通之后,话务员(在境外窝点或境内话务团队)通过VOIP链路远程接入,被叫用户听到的是语音网关后面的真人声音,而不是机器人语音,这也给技术识别增加了难度。
2. 反诈大模型的预警原理:不靠听内容,靠话单行为画像
2.1 核心思路:从“听内容”到“看行为”
很多人一听到“反诈大模型”,下意识认为它是靠语音识别、自然语言处理去“听”通话内容判断是不是诈骗。实际上,在运营商网络侧,这条路走不通——出于用户隐私保护和通信保密的要求,运营商不能也不应该去监听通话内容。大模型真正做的,是围绕“行为”做文章。
什么叫行为画像?举个例子:一个普通的家庭固话,一天呼出量不会超过两位数,通话时长通常在几十秒到几分钟,而且会有呼入呼出的双向流量,深夜基本休眠。一个正常企业的客服电话,起呼量大,但会有相应的呼入比例,通话平均时长较长,回拨率也不低。
黑盒呼叫则是另一套行为模式:主叫号码列表里可能只有几个到十几个号码,但每一个号码都在短时间内高频外呼;被叫号码几万个,遍布全国各地;通话时长中位数在10秒以内,大量呼叫在2到5秒内被运营商拦截或用户挂断;几乎不发生呼入,号码对外的形象就是“只出不进”。
这套行为模式放在一个号码上看可能不明显,因为单号码单日的呼叫量可能只有一百来次,但放在“号码组+端口+设备”的聚合维度上看,特征非常鲜明。大模型做的就是这个事情:把单点行为放到群组行为里去比较,找出那些“反常态”的呼叫聚簇。
2.2 行为画像特征体系
在实际建模中,我们用的特征体系大致分四层,每一层解决一个维度的识别问题:
| 特征维度 | 关键指标 | 涉诈黑盒的典型表现 |
|---|---|---|
| 呼叫规模特征 | 日呼出总量、时段分布、并发通道数 | 日呼出数百至上千通,集中在8:00-21:00,通道长时间满载 |
| 通话质量特征 | 平均通话时长、接通率、回拨率 | 平均通话时长极短,接通率低于15%,回拨率低于5% |
| 号码关系特征 | 主叫号码与被叫号码数量比、号码重合度 | 主叫号码极少,被叫号码极多且几乎零重合,形同“广播式”外呼 |
| 线路资源特征 | 话务端口承载量、端口迁移频次、网关注册稳定性 | 单端口承载话务远超正常值,且设备会周期性变更接入端口 |
这四层特征单独拿出来任何一层都不足以定罪,比如呼叫规模大这一点,很多电销公司、催收公司也符合。但四层特征叠加后,诈骗黑盒的可疑程度会急剧上升。逻辑很简单:正常的正规外呼业务,不可能同时满足“超高频外呼、超短通话、几乎无回拨、号码零重合”这四个条件。
这里特别说一下“回拨率”。正常企业外呼后,客户可能会回拨咨询,回拨率通常在10%以上,好的客服中心能做到30%。诈骗黑盒则几乎没有回拨——因为被叫用户要么挂了,要么意识到是诈骗甚至已经报案了,谁会回拨一个刚才疑似诈骗的号码呢?回拨率极低是区分“正常外呼”和“骚扰/诈骗外呼”的黄金指标之一。
2.3 大模型在这里的角色:召回加精细研判
纯靠专家规则也能做这些特征统计,那为什么还需要大模型?关键在于两点:规模的爆炸和特征的组合空间。
一个省级运营商的每日话单量动辄数亿条,涉及号码数千万个。规则引擎可以处理“日呼出超500次”这种单维度告警,但处理不了“呼叫行为在某些维度正常、某些维度异常、且异常模式不断变化”的复杂情况。诈骗团伙不是在原地等着被规则命中,他们会调整呼叫时段、控制单日总量、切换线路来规避单点检测。
大模型的做法是先用宽召回把可疑范围缩到很小,再对候选集做精细打分。第一阶段的召回模型可以理解为一个“筛子”,输入是无差别的话单特征,输出是行为异常的候选号码组,这一步可以把十亿级的话单数据筛到几万个可疑号码组;第二阶段再用更精细的序列模型和图模型去打分,结合号码之间通话关系、主叫被叫的时空共现、与已知涉诈号码的关联度,最终输出的是一批高置信度的预警线索。
这里用到的模型结构主要是图神经网络加时序模型。通话关系天然适合用图来表达:主叫号码、被叫号码、设备端口、注册IP、宽带账号,都是图中的节点;一次呼叫就是一条边。诈骗团伙控制的黑盒会在图中形成一个“多发散、少汇聚”的异常子图,这种结构特征靠人工经验看不出来,交给图模型去计算,效率高得多。
3. 从一条异常话单到一台物理设备:预警核查与研判全流程
3.1 预警产生后的第一轮核查
大模型输出的是一批高置信度的异常话单簇,但模型说“异常”不等于实际就是涉诈,到现场之前必须有一轮人工研判和交叉核验。这个环节我把它叫“冷处理”,因为一上来就激动只会白跑一趟。
核查的第一步是拉详单。把预警关联的主叫号码、起呼时间、被叫号码、通话时长、呼叫频次全部导出来,按小时粒度看一下呼叫热力分布。重点看两点:起呼时间是否高度集中在工作时段;是否存在凌晨时段的密集呼叫(正规外呼极少在凌晨工作,但如果出现了,大概率是骚扰或诈骗)。
第二步是查号码属性。主叫号码在运营商侧是什么业务类型?普通住宅固话、企业直线、中继线路,业务类型决定了话务能力的天花板。一个普通住宅固话,如果每天呼出几百通,不用再怀疑,它一定不是正常使用方式,要么号码被盗打,要么线路被接入了黑盒设备。
第三步是查线路和端口信息。通过话单里携带的端口标识,溯源到接入网设备。这一步很关键,能看到这条线路下挂着多少号码、目前的并发呼叫数是多少、近期是否有端口迁移记录。黑盒设备接入后,端口的并发数会异常偏高,正常家庭宽带接入的语音端口并发不会超过2路,而黑盒设备后面的端口并发可能长期在十几路以上。
这三步走完,基本可以确定这个线索值不值得推送到反诈中心。正常来说,一个月下来真正能走到“现场查处”这一步的预警不到五分之一,其余大多是电销公司、催收公司、营销外呼平台的行为异常,虽然也烦人,但属于监管整改范畴,不构成涉诈打击条件。
3.2 从号码特征到端口归属:话单溯源
研判确认异常后,下一步就是话单溯源。简单说,就是从“哪个号码在频繁外呼”一路追到“哪个物理端口、哪条宽带、哪个地址”在承载这些呼叫。
话单里其实藏着完整的信令路径。每一次呼叫,从用户终端到核心网,会经过接入设备、汇聚交换机、中继网关等多个节点,每个节点都会在话单或信令追踪记录里留下标识。在HLR侧可以查到号码所属的接入网元,在接入网侧可以查到具体端口,在BRAS或宽带的认证日志里可以查到PPPoE拨号账号与IP地址的对应关系。
实际操作用的工具包括运营商的综合网管系统、信令监测平台和资源管理系统。通过综合网管查端口状态和告警,通过信令平台追踪某号码的注册位置和呼叫链路,通过资源系统查宽带账号登记的装机地址。三条线一交叉,基本就能把这个号码背后的物理位置锁到一个机房、一个分光器、甚至一个具体的用户端口。
比较棘手的是“一拖多”的情况:一台黑盒设备接入了运营商的一条宽带线路,但设备本身支持多个语音通道,背后对应多个虚拟号码。这些号码看话单是完全独立的,不放在一起分析永远想不到它们出自同一个物理设备。这时候就需要回到端口维度去做汇聚,把所有挂接在同一端口下的话务全部拉出来看,才能看到全貌。所以大模型的输出不能只停留在号码层,一定要能和资源层的端口数据打通,这个联动能力是模型能否真正落地的关键。
3.3 与公安反诈中心的联动节点
运营商内部研判完成之后,就到了和公安反诈中心的联动阶段。每个省的反诈中心都有派驻的运营商工号,可以直接登录运营商的话单查询平台,也有专门的涉诈线索推送通道。
推送的时候要带全几样东西:预警研判报告(讲清楚为什么怀疑是涉诈)、嫌疑号码列表(号码、起呼时间、频次、通话时长统计)、溯源信息(端口、宽带账号、装机地址)、以及话单分析结论(行为特征是否符合涉诈呼叫模型)。这些材料统一封装成一个线索工单,通过反诈系统推送,同时电话同步通知值班民警。
为什么强调材料完整?因为反诈中心接收的线索每天量很大,如果只是丢一个号码过去,民警没法评估线索价值,很可能压后处理。而完整的技术研判材料,可以让民警直接启动调查,按照我们提供的地址线索安排蹲守或实地排查。好的线索推送应该做到“民警拿着材料就能知道去哪、查什么、怎么布控”。
这里有一个重要的合规边界:运营商只负责提供网络侧的技术线索和支撑,不参与抓捕、不进入现场处置。现场搜查、设备缴获、人员控制,这些环节完全由公安机关依法执行。运营商的角色是“助攻”而不是“主攻”,这个定位必须清楚。
4. 现场处置与设备取证的关键细节,以及一次完整联动过程
4.1 现场排查的注意点
民警到了现场之后,运营商负责网络侧配合的人一般不需要进入室内,主要在外围提供技术支撑,但现场排查的很多细节值得说一说,对后续双方协作有参考价值。
技术人员的第一个动作是远程刷新端口状态。在黑盒设备运行的情况下,对应的端口会有持续的话务流量,网管侧能看到实时告警和并发数。但要注意,如果在民警到达之前嫌疑人远程关停了设备,端口流量会瞬间归零,网管侧看到的就是“无异常”,因此行动前一定要确认端口当前是否有真实时话务,避免扑空。
设备位置排查和网络运行状态是联动的。在疑似窝点门口,可以用网管平台的端口运行状态做“远程嗅探”,看这个端口在当前时刻是否还有持续的RTP语音流。如果设备还在运行,民警进门后极大概率能第一时间发现正在闪烁指示灯的黑盒。
空间排查也要讲技巧。黑盒设备藏在吊顶里的概率相当大,其次是弱电井、床底、空调检修口。进门后不要只盯桌面和常规设备位,要先看有没有网线往天花板上走,有没有不合理的网线穿墙孔,顺着线找,设备基本跑不掉。办案民警的经验是“先找网线,再找设备”,网线的尽头就是答案。
4.2 设备取证规范流程
设备缴获后的取证环节,直接影响后续的定罪量刑和关联打击,几个操作规范特别重要。
第一,绝对不能先断电。黑盒设备一旦断电,设备内存中的注册信息、远端服务器地址、活动会话记录全部丢失,有些设备甚至配置了远程清除机制,一断电重连就会自动恢复出厂设置。正确的做法是保持设备通电,先拍照固定设备状态,记录指示灯状态、网线连接情况、设备接入了哪些线路。
第二,记录关键信息要完整。设备型号、序列号、MAC地址、WAN口IP、LAN口配置、设备当前注册的SIP服务器地址,这些信息全部要登记。SIP服务器地址尤其重要,顺着它往往能查到诈骗团伙的呼叫平台服务器实际所在地,为打击上游窝点提供线索。
第三,物理链路关系要画清楚。黑盒设备的网线接的是哪台交换机、哪个端口,电源来自哪个插座,是否连接了额外的路由器或者无线AP,全部记录在案。这些物理关系是后期重建犯罪链路的关键证据。
第四,涉案设备要单独封装、单独送检。黑盒设备里有大量电子数据,包括注册配置、呼叫日志、远端管理地址等,这些数据的提取要在有资质的电子数据鉴定机构进行,不能由现场人员自行操作,避免程序瑕疵影响证据效力。
4.3 一次完整联动时间线复盘
举一个实际案例,把整个流程串起来,大家感受一下各环节的时间节奏。
上午9:47,大模型输出一条高危预警:某县区一个号码段出现异常呼叫聚簇,涉及号码17个,日均呼出2700余次,回拨率仅3.1%。模型命中“话务量突增+平均通话时长极短+回拨率极低”的高危规则。
上午10:20,研判岗完成第一轮核查。通过详单导入和分析,发现主叫号码均为该县区同一号段的固话号码,但装机地址分布在同一个写字楼商圈的多个楼栋。进一步查端口,所有号码的话务集中在同一台接入设备的两个PON口下。
上午10:50,向反诈中心推送线索工单,包含号码列表、端口信息和装机地址范围。市反诈中心接到线索后,联系属地分局启动研判。
下午13:30,属地分局反馈:其中一个装机地址的租户登记为一家“网络科技公司”,但该公司实际注册地在异地,明显异常。同时,外围侦查发现该房间近期有人员频繁进出,但屋内长期拉着窗帘。
下午15:10,民警进入现场检查,在房间吊顶内发现一台正在运行的VOIP网关设备,旁边还连着两台路由器和一个交换机。设备面板指示灯快速闪烁,明显处于高负载状态。
下午15:40,运营商技术支撑人员配合完成端口停用和线路核查,现场登记了设备的MAC地址、SIP服务器域名等关键信息。后续电子数据鉴定中,从设备里提取到了完整的呼叫日志和远程管理账号,关联出了远端管理IP,为后续上游打击提供了线索。
从预警到缴获设备,前后不到6个小时。这就是模型能力+人工研判+联动机制叠加的效果。
5. 大模型的误报与迭代:工程师视角的踩坑总结
5.1 实际运营中遇到的误报类型
大模型预警不是百发百中,误报率在系统上线初期尤其高。梳理一下我们遇到的主要误报类型,给同行做个参考。
第一类误报是电销公司。正规的电销团队一天的外呼量也非常大,有时单日能到几千通,而且通话时长普遍很短——用户一接就挂,接通率同样不高。但电销公司通常有固定的行业属性,号码段集中,呼入和呼出并存,回拨率一般比涉诈黑盒高。要区分这两类,关键看号码关系图中的结构:电销是中心辐射状,大量呼叫指向零星分散的对象,但号码对外可见、可回拨;涉诈黑盒则是“单向封闭式”的,几乎不允许呼入。
第二类误报是催收公司。催收话务的呼叫时段极其规律,集中在早八点半到晚九点之间,时段特征和涉诈黑盒几乎一样,单号码的呼出量也很夸张。但如果把号码标记和投诉数据接进来,会发现催收号码的投诉记录集中在“骚扰”“交易纠纷”而非“诈骗”,这个差异可以用来校准模型。
第三类误报是大规模通知类外呼。比如银行、保险公司的业务告知电话,虽然日呼出量极大,但号码是规范的95/400客服号码,且在运营商侧有正规中继线路备案,资源特征和黑盒完全不同,在特征上容易区分。
第四类误报比较刁钻——真正的“沉默”黑盒。有些设备部署之后长时间不发起呼叫,只是保持SIP注册状态,静默等待指令。这类设备没有任何话单行为,模型识别不了,只能靠线路巡检和端口状态监测发现。这也是模型能力的天花板,需要靠其他维度的数据去补足。
5.2 模型迭代的几个方向
第一,特征速度要跟上设备迭代速度。早期黑盒设备的特征是全天不间断高频呼叫,后来诈骗团伙学聪明了,把呼叫时段调整得更接近正常企业,甚至加入了“饭点休息”的规律。模型的特征体系如果固定不动,很快会被对方摸清并规避。实际上线中,我们发现单靠话单行为特征已经不够,需要把资源侧的端口状态、接入设备型号、宽带装维记录一并纳入候选特征,形成话单+资源+空间位置的联合特征。
第二,跨域泛化很重要。一个省识别出的涉诈IP、设备指纹、端口规律,要能同步给其他省份联合建模。黑盒设备是流窜作案,今天在这个省,明天换到另一个省,省际数据不通,模型就存在“区域盲区”。目前反诈大模型的一个重要迭代方向,就是做跨省话单特征的对齐和联合训练。
第三,图模型的引入改变了识别精度。最初版本的做法是单号码维度做孤立点检测,后来扩展到号码共现图和端口共现图,再到现在的多关系图模型。每次结构调整都会带来精度提升,但也伴随计算开销的大幅增加,需要做好在线推理的时延和资源压测。
第四,人机协同的闭环反馈机制。预警是否准确、现场是否查获设备,这些结果要回流到训练集中。不能只靠算法工程师自己拍脑袋定标签,要和反诈中心建立结果复盘的机制,定期把真实案例导入模型重新训练。没有闭环反馈的模型,上线半年基本就废了。
5.3 后续工作建议
从实际经验来看,反诈大模型的持续有效依赖三件事:高质量的话单和端口数据打通、常态化的预警研判闭环、以及和公安侧的高效联动机制。技术再强,数据不打通、流程不顺,发挥不出实战效果。
另外建议建立“话单异常+设备指纹+空间位置”的三元档案。每一台被核查的设备都生成一个数字档案,记录它的行为特征、注册IP、关联号码、现场查处信息。当新的流量特征与历史档案相似时,系统可以更快命中,减少重复研判的工作量。
最后说一个容易被忽视的点:VOIP黑盒不是一成不变的,诈骗团伙也在关注反诈技术的进展。设备在更新、协议在调整、部署方式在变化,有的案件里已经出现了使用加密传输、频繁切换注册服务器的黑盒设备。应对这些变化没有捷径,只能靠持续建模、持续研判、持续与一线反馈保持同步。反诈是一项长期对抗工程,模型预警只是其中的一环,这一环做实了,后面的处置环节才有发力基础。