做供应链金融、中小企业融资相关实证研究的人,很容易卡在一个地方:非上市企业的融资数据基本拿不到。年报只覆盖上市公司,银行信贷数据又锁在机构内部,想研究中小企业怎么融资、找谁融资、融到多少,往往只能靠问卷或者手工爬虫凑合。中征应收账款融资服务平台的数据,正好把这条链路补上了一大块。现在CnOpenData把它整理成结构化字段上线,对做相关领域研究的人来说,等于省掉了大量清洗和采集的体力活,直接拿到一份可以进模型跑回归的样本。
这个库的价值不在于字段有多炫,而在于它记录的是真实发生的应收账款融资行为:谁在融资、谁在放款、哪一天登记、金额多少、是否注销。基于这套逻辑,它可以支撑企业融资约束、供应链金融发展、地区信贷供给差异、金融机构展业行为等一批研究选题。对于银行风控条线、商业保理公司、产业互联网平台的数据团队来说,它也提供了一个观察应收账款融资市场格局的窗口。
这篇内容主要写给两类人:一类是做学术研究的朋友,刚拿到数据不知道从哪下手,需要明确字段口径和应用逻辑;另一类是金融机构或咨询机构的数据分析人员,想评估数据能不能用、怎么和内部数据结合。我会把字段拆解、数据清洗步骤、研究构建方案和踩坑记录都过一遍,尽量做到看完能直接上手。
1. 项目概述:这个库究竟解决什么问题
1.1 为什么中征平台的数据值得关注
先简单交代一下背景。中征应收账款融资服务平台是央行征信中心主导建设的,企业拿应收账款做质押融资时,需要在平台上办理登记。这套登记制度的核心逻辑是“登记对抗”——债权债务关系经过公示,有据可查,避免重复质押。也正因为有这层制度设计,平台上的登记记录具备了两个难得的特性:统一和连续。
统一,指的是所有参与主体都按同一套登记规范在录入信息。不管是大型银行、城商行,还是商业保理、融资租赁公司,登记字段的核心结构是一致的。对比各家银行分头报送的信贷数据,这种统一性省掉了大量字段对齐的功夫。
连续,指的是登记信息按时间滚动累积。研究时间序列问题,比如某个行业景气度变化对应收账款融资活跃度的影响,就有了天然的样本基础。不同于调研数据的一次性截面,登记数据可以拉到多年的跨度,做面板分析的可选范围宽很多。
CnOpenData做的整理工作,本质上就是把平台上这些登记记录变成规范化的表格。它补上了原始数据里缺失的统一社会信用代码、标准化企业名称等关键字段,让研究者不需要自己再去处理那些五花八门的登记文本。这一步看着简单,实际省掉的时间相当可观。
1.2 这个库适合谁用
第一个群体是高校和科研院所的研究人员。以应用经济学、金融学、会计学为主,做公司金融、供应链金融、区域金融差异的选题。这类人群对数据的要求是干净、可追溯、字段解释得清楚,能在论文里写明白数据的来源和口径。
第二个群体是金融机构内部做风控和产品分析的人。银行对公信贷条线、保理公司、融资租赁公司,想了解市场上有多少同类业务在做、集中在哪些行业和地区、单笔金额分布如何。这些信息虽然不是完整的同业明细,但作为市场画像参考绰绰有余。
第三个群体是地方政府、产业园区、行业协会做中小企业融资分析的工作人员。评估一个地区供应链金融的活跃程度,或者某个核心企业的上下游融资配套情况,登记数据比问卷访谈客观得多。
不同群体使用数据的方式会不一样。研究者看重覆盖度和字段完整度,机构分析人员更关注业务逻辑和风险信号,第三方评估机构则需要能交叉验证的数据维度。但共同点是都需要一个真实、可追溯、相对全量的融资登记数据源,这正是这个库能提供的。
1.3 跟其他公开金融数据有何不同
市场上能拿到的信贷类数据,大概有几种:银行间市场披露的ABS底层资产信息、上市公司公告里的应收账款融资公告、部分地方金融监管局公示的小贷和保理业务数据。这些数据各有价值,但都有明显的覆盖盲区。ABS数据披露质量高却只覆盖证券化业务,上市公司的公告样本少且偏向大企业,地方金融监管数据口径不一致,跨区域可比性差。
中征平台的登记数据恰恰能补上这些盲区:它以登记制度为约束,覆盖范围广,业务类型多样,且不偏向某一个机构类型。当然它不能替代银行内部信贷数据,因为登记本身是一种法律公示行为,不是完整的信贷审批记录。但它和现有的公开数据源叠加,就能拼出一张比之前完整得多的中小微企业融资图谱。
2. 数据拆解:字段结构与应用逻辑
2.1 核心字段说明与业务含义
要理解这个库怎么用,先把字段和业务含义对上。以下是这个库里的核心字段以及它们对应的登记业务要素,我用研究视角来解释每个字段能干什么:
| 字段 | 业务含义 | 主要研究用途 |
|---|---|---|
| 登记编号 | 每笔登记的唯一标识 | 识别重复记录、追踪后续变更和注销 |
| 出质人名称 | 融资企业名称 | 匹配工商信息,判断企业规模与行业归属 |
| 出质人统一社会信用代码 | 融资企业的唯一代码 | 做精准匹配,最核心的join key |
| 质权人名称 | 资金提供方名称 | 识别放款机构类型,观察机构展业偏好 |
| 登记日期 | 登记业务办理时间 | 构造时间序列,衡量融资活跃度变化 |
| 注销日期 | 登记注销或债务结清时间 | 测算融资存续期,识别终止状态 |
| 担保物权类型 | 质押物类型(应收账款、动产等) | 区分融资结构,做业务类型分层 |
| 被担保主债权数额 | 登记的主债权金额 | 衡量融资规模的核心指标 |
| 登记状态 | 已登记、已注销、变更 | 决定样本筛选逻辑,直接影响统计口径 |
这里有一个业务概念值得展开:登记金额不等于实际放款金额。平台上的“被担保主债权数额”是登记时约定的主债权金额,对应的是质押担保的额度上限或融资合同金额,和最终实际发放的贷款金额不一定完全一致。做实证研究时,这个字段更适合当作融资规模的一个“衡量的近似指标”,而不是精确值。好在登记制度本身的规范性保证了数据相对可靠,在做大样本分析的时候,它的价值仍然很高。
2.2 数据版本、时间范围与获取方式
CnOpenData上线的这个库,具体覆盖的时间范围和版本口径,建议以官网的数据详情页为准。这类登记类数据存在两个特点:一是动态累积,每天都有新增登记和注销记录;二是历史记录保留,早期登记过的业务还会出现在后续数据里。因此拿到手里的数据本质上是某个时点的“快照”,分析时要清楚自己用的是哪个版本。
获取方式上,需要到CnOpenData网站提交数据需求,经过授权审核后按要求使用。学术用户需要确认用途符合授权范围,机构用户需要留意数据是否可以用于内部系统集成。数据格式一般提供Excel和CSV,建议直接用CSV导入统计分析工具,避免Excel对长数字的截断问题——千万记住,统一社会信用代码这类长ID字段,不管用什么工具,都要按文本格式读取。
2.3 与工商数据、行业数据联动的思路
这套数据单独使用的场景很广,更常见的做法是和外部数据匹配。最优先推荐配的是企业工商注册数据。统一社会信用代码可以直接关联,匹配上之后,企业基本信息、行业门类、注册地区、注册资本全部能对上。这就把“一个融资登记记录”升级成了“一个有完整画像的融资企业的行为记录”。
第二个值得匹配的数据源是核心企业关联关系。应收账款融资往往发生在供应链场景里,融资企业的下游债务方通常是核心企业。把这层关系匹配出来,可以识别出哪些核心企业的信用在真正传导给中小企业,哪些地区的产业链金融配套更完善。再进一步,和司法数据、招投标数据、税务数据组合,就可以做还款能力、违约风险、经营活跃度相关的延伸研究。
3. 实操要点:从原始登记到研究数据
3.1 数据清洗的几个关键步骤
拿到数据第一步,不是急着统计量,而是把数据质量把好关。基于我对登记类数据的处理经验,清洗工作围绕四个环节展开。
第一环节:企业名称标准化。登记数据里的企业名称,肉眼看着正常,但细节差异很大。全角半角括号不统一、“有限公司”和“有限责任公司”混用、名称里带了“(上海)”“(山东)”之类的地域后缀、个别还有中间多了空格的情况。建议先做一遍规则清洗:统一括号、去掉多余空格、删除明显干扰头尾的字符。能靠统一社会信用代码精确匹配的优先用代码匹配,配不上的再用名称相似度匹配。
第二环节:登记状态分类。把“已登记”和“已注销”的记录分开处理。如果研究的是当期融资活跃情况,应当以“已登记”状态的记录为主体。但如果不是做存量分析,而是做业务流水的增量分析,那么所有登记记录都要保留,只是统计口径上要区分“新增登记”和“当前存续登记”。
第三环节:金额单位与异常值处理。登记数据里的金额可能精确到元,位数较长,运算起来不太方便,统一转成万元更顺手。与此同时,金额字段的分布通常非常偏,单笔从几十万到数亿都可能有,直接用原始金额进模型容易让结果聚焦在大额样本上。一般做法是:转完单位之后,再做1%和99%分位的缩尾处理。
在Stata里可以这样操作:
* 金额单位转为万元 gen amt_wan = amount / 10000 * 对金额做1%和99%缩尾处理 winsor2 amt_wan, replace cuts(1 99) * 登记日期转为Stata日期格式 gen date_reg = date(登记日期, "YMD") format date_reg %td这些操作看着基础,但每一行都有直接用途:单位转换是为了结果可读,缩尾是为了避免极端大额记录过度影响回归系数,日期格式转换是为了后面生成年度、季度变量时不报错。
3.2 一个可落地的研究指标构建案例
空讲字段怎么用有点抽象,我拆一个实际的指标构建过程出来。假设想做“地区供应链金融发展水平”相关的分析,一个被广泛接受的度量思路是:用应收账款融资登记活跃度来刻画地区供应链金融渗透情况。
按这个思路,构建流程分四步。
第一步:从原始数据中提取出质人的统一社会信用代码,和工商库匹配,得到每家融资企业的注册地城市信息。
第二步:按城市和年份两个维度聚合数据,统计每个城市每年发生多少笔登记、登记金额合计多少。这一步注意,一家企业一年可能登记多笔,按笔数计数是业务活跃度,按企业唯一计数是覆盖广度,两个口径都要留好。
第三步:构造相对指标。比如登记金额之和除以当地规模以上工业企业数量,或者登记笔数除以当地GDP。用相对指标主要是为了剔除地区经济体量差异的影响,避免大城市天然看起来活跃。表达成公式就是:
地区供应链金融活跃指数 = ln(1 + 该地区当年登记金额合计 / 该地区当年规上工业企业数量)加自然对数是为了压缩极值,加1是为了让没有登记记录的地区不产生缺失值。
第四步:把构造好的指标放进面板数据,结合地区层面的银行分支机构数、金融科技发展指数、产业集聚度等变量,就能做出很有解释力的实证结果。整个过程里,数据清洗做的每一步都在给这个指标“打地基”。
3.3 关键认知:登记和放款之间还存在距离
前面讲了登记金额不等于实际放款金额,这个是使用这个库绕不开的一个核心认知,我再展开说说它在分析场景里的实际影响。
当登记状态显示“已注销”时,有两种业务可能性:一种是债务已经结清,质押关系解除;另一种是这笔融资最终没有落地,或者签约后取消了。单看登记记录,无法判断到底是哪种情况。因此做“融资可得性”研究时,不能把“发生过登记”等同于“成功融到钱”,更稳妥的做法是做一个保守的口径:只用“登记状态为已登记且存续时间在半年以上”的子样本做稳健性检验。
另外,有些授信业务是循环额度,企业可能在一个额度框架下多次登记,每一笔登记的金额是单笔使用的金额,而不是合并后的余额。做企业融资规模分析时,建议把一家企业一年内所有登记的金额先汇总,再看最高单笔、总笔数和覆盖的时间跨度,综合分析得到的图景才完整。
4. 常见问题与排查技巧实录
4.1 使用前先想清楚的几个问题
每次拿到新的登记数据,团队内部集中踩坑的概率最高的几个点,我按优先级列一下。
数据覆盖范围的边界。中征平台登记的业务是基于登记制度形成的,主要覆盖应收账款质押、部分动产融资等类型。企业拿房产抵押、信用贷款这类传统业务,不会出现在这个数据里。分析时不要把某个行业的登记量等同于整个行业的融资总量,它反映的更多是供应链金融语境下的融资行为。
多个登记编号对应同一企业。单一企业可以有多笔登记,甚至同一天出现数笔不同金额的登记。处理不当,会把一笔“企业融资记录”误当成“企业数量”。在企业层面做统计时,先要用统一社会信用代码去重,再确定统计单位。
版本快照的时间窗口。数据有更新时,新版本和旧版本的记录数可能差别很大。建议在一个分析周期内固定使用某一个版本,不要混合多个下载批次的数据。如果遇到跨版本的数据集拼接,务必以登记编号为主键做去重校验。
4.2 实战避坑笔记
下面这几条,是实际操作中容易忽略但影响很大的细节。
第一,处理统一社会信用代码时,Excel可能会自动把长数字转成科学计数法。务必先把整列转成文本格式再打开,导入Python或Stata后,再用字符串类型读取,否则代码匹配步骤会大量失败。
第二,质权人名称里的机构标签,建议做一轮标准化规则处理。比如名称里包含“银行”的归为银行类,包含“保理”的归为保理类,包含“融资租赁”的归为租赁类。这步做出来,后面做机构类型对比分析会轻松很多。
第三,注意企业名称的跨期变更。企业在不同年份可能改名,但统一社会信用代码不会变。所有涉及企业级别的匹配,一律先把统一社会信用代码作为唯一主键,名称仅作显示字段,不要拿名称当主键。
第四,登记日期字段在导入时要留意格式识别。如果原始表给到的是“2023年5月6日”这类中文格式,直接按日期导入大概率报错。建议先统一成“2023-05-06”这类标准格式再导入,否则没法做年度聚合。
4.3 问题速查表
| 常见问题 | 排查思路 | 处理建议 |
|---|---|---|
| 与工商库匹配率过低 | 检查企业名称规范化和字符格式 | 先按统一社会信用代码精确匹配,再做名称模糊匹配 |
| 金额数据出现异常大的极值 | 核对金额单位是否统一 | 统一转为万元,做1%/99%缩尾 |
| 某个城市的登记量突然下降 | 排查是否使用旧版本快照 | 更新到最新版本,确认统计区间口径一致 |
| 日期变量聚合报错 | 检查日期格式是否统一 | 统一转为标准ISO格式后导入 |
| 按企业统计出现重复值 | 检查是否漏了同一登记编号的多笔记录 | 用登记编号唯一性校验,再按企业汇总 |
这套速查表不是我凭空写的,每一条都有对应的真实排查场景。比如匹配率过低这个坑,早期做的时候不重视,后来发现是名称里全角半角括号混用导致的,一条正则替换就解决了大半问题。所以建议拿到数据后,先花半小时跑一遍基础质量检查,后面能省下好几个小时的返工时间。
5. 几点实操体会
从实际操作来看,这个库的整理质量在公开数据源里算比较省心的,结构清晰,字段语义和登记制度对得上。我的建议是拿到新版数据集之后,先写一个checklist脚本,连续跑三样检查:登记编号是否唯一、统一社会信用代码缺失率是多少、日期字段有没有非法值。这三项过关,后面进入匹配和聚合环节基本不会出现大问题。
按我个人的使用习惯,这套数据最有价值的方向不是单独使用,而是与工商注册数据、司法风险数据、招投标记录组合起来。只靠登记数据,能回答“融资行为发生了什么”;叠加上企业基本面和风险信息,才能回答“什么样的企业更容易获得应收账款融资”以及“融资之后的违约表现如何”。对供应链金融研究来说,这种“登记数据+企业画像”的分析思路,能支撑的研究深度比单表分析高一个层级。
另外多说一句,数据合规意识要放在前面。登记信息涉及企业融资行为的敏感内容,虽然平台和CnOpenData已经做了脱敏加工和字段整理,下载和使用时还是要严格在授权范围内,不用于预测单个企业信用评分,不用于商业营销或未经授权的名单筛选。分析结果公开发布时,也建议以统计口径呈现,不披露具体企业名称。合规这条线守住,做研究和写报告的时候才能踏实。