☰
A股高管迷信数据集:行为金融与量化研究的新维度
2026/10/2 22:30:39 网站建设 项目流程

1. 先聊聊这个数据集的定位和它解决的独特问题

做AI数据集的朋友看到这个标题,第一反应往往是:金融领域也要研究迷信?这个反应恰好说明——A股上市公司高管迷信相关数据,不是拿来猎奇看的,而是行为金融学里一个很实用的边缘变量库。它围绕2008-2025年A股上市公司高管展开,记录出生年、生肖、姓名笔画、八字五行、公司股票代码吉凶、重要公司事件的择时偏好等信息,用来回答一个严肃问题:高管的个人迷信倾向,到底会不会影响上市公司的实际决策。

这套数据最直接的用途是给学术研究和量化研究补一个此前很难拿到的维度。过去大家看公司基本面看财务报告,看治理结构看董事会规模,但管理层信不信风水、生日落在哪个生肖周期、上任时间是不是挑过黄道吉日,这些信息分散在招股书、年报和公告里,没有人系统整理过。如果你想把“高管个体特征→公司决策”这条路打通,这套数据就提供了最底层的一层标签层,你可以直接拿它做回归、做事件分析、做工具变量,也可以把它当作一个另类因子库,结合传统财务因子使用。

我个人更推荐三类人重点参考:一是做公司金融或行为金融的硕博研究生,这套数据能帮你在“CEO本命年与企业风险承担”“迷信对并购择时的影响”这类选题上省掉大量手工采集的时间;二是券商和资管的量化研究员,可以把它用来构造另类情绪因子,比如高管迷信指数和公司投资力度的相关性;三是做数据治理或者数据产品设计的朋友,这个数据集从定义、采集、清洗到验证的整个流程,本身也是一个很有参考价值的范本。

1.1 高管迷信不是玄学,而是行为金融研究里的真问题

先说一个容易被人误解的点:研究迷信数据,不等于承认迷信有效。行为金融学关注的是“人如何做出不完美的决策”。西方学术界早有大量研究证明,CEO如果从小生活在宗教氛围浓厚的地区,长大后的风险偏好会明显偏保守;中国学者随后发现,类似效应在本命年、生肖周期和姓名数理上同样存在。比如有研究指出,在本命年附近任职的CEO,更倾向于减少资本开支、降低负债率,似乎是在主动规避“本命年运数不佳”带来的心理风险。另一些研究发现,股票代码末尾数字为4的公司,IPO折价率更高、流动性更差,因为投资者主动回避“不吉利”的标的。

这些研究里,“迷信”不是凭空而来的玄幻概念,而是一种稳定的个人信念或区域文化变量,会影响决策者的判断权重。高管做并购、定分红、选上市日期时,不一定真认为风水能改变未来,但长期浸润在特定文化环境中的人,会下意识选择一个“更顺”的时间点,或者在不确定性很高的时候更加保守。这种影响是潜意识的,但最后会落在财务报表和公司行为上。所以数据集的价值不在于告诉你“哪个老板迷信”,而在于给你一个可量化的解释变量,去检验这些行为是否产生了统计上显著的结果。

1.2 一份横跨17年的迷信标签库到底能做什么

把时间窗口定为2008-2025,不是随手划的。2008年之前,很多上市公司的高管简历披露不规范,姓名、出生年月、教育经历经常缺失,那之前的样本做出来偏差会很大。2008年以后,年报披露要求逐步细化,高管基本信息基本稳定覆盖;2025年则代表当前可获得的最新完整年度。这个区间刚好覆盖了2008年金融危机、2013-2015年创业板牛市、2018年商誉暴雷、2019-2021年核心资产行情、2022-2024年的震荡下行,跨越了完整的牛熊周期。迷信行为在逆境和顺境中的表现很可能不同,这个时间范围足够支撑分阶段、分市场环境的对比研究。

从应用场景上说,这套数据至少有三条路可以走。第一条是实证检验:把高管是否处于本命年、姓名吉凶评分、公司是否包含吉祥字眼等变量作为解释变量,去检验对研发投入、并购溢价、分红力度的影响;第二条是事件研究:围绕IPO、并购公告日、高管上任日是否落在“吉日”上,观察事件窗口内的市场反应;第三条是因子构建:用迷信指数合成一个大股东或高管层的“偏好因子”,作为风险预警或持仓风格的辅助指标。无论哪条路,都需要先把底层数据拆清楚。

2. 数据集的核心字段设计:从个人迷信指标到公司迷信行为

做数据集最忌讳的是“有数据但不知道存什么”。我接手这个项目的第一件事,就是把字段拆成两层。第一层是高管个人的静态标签,包括出生信息、生肖、命理特征、姓名数理、籍贯文化背景;第二层是公司层面的动态行为标签,包括股票代码特征、公司名用字、关键事件择时、分红和融资的数字偏好。两层分开存,后面做分析时就能灵活结合,不用重复改库。

2.1 高管个体迷信标签:生肖、八字、五行、姓名数理

高管个体标签是整个数据集的根基。原始简历里最有价值的是“出生年月”这个字段,它能直接推导出生肖和干支年份。我把这一层设计成一张宽表,核心字段大致如下:

字段分组典型字段取值示例说明
身份标识证券代码、姓名、性别、出生日期600000.SH、张某某、男、1973-05-02用于关联交易数据与财务数据
时间标签出生年、干支年、生肖1973年,癸丑年,牛干支年按立春切换,不以春节为准
命理标签本命年标志、犯太岁、五行属性2017年为本命年=1;五行属木本命年指年龄为12的整数倍
姓名数理名字笔画数、三才五格评分人格31、总格41按繁体笔画计算,需统一姓氏用字
区域文化籍贯省份、出生地类型浙江、地级市用于构造地区迷信强度指标

这里有一个容易争论的点:姓名笔画到底按简体算还是繁体算。我最终选择标准繁体字库,因为五格数理传统上以康熙字典笔画为准。但现实中高管名字常含常见简化字,比如“刘”简化为“刘”,笔画差异很大。我的做法是保留两套笔画结果,默认用繁体笔画,简体笔画作为稳健性检验的替换变量。地区变量也很关键,因为不少研究把“出生地是否属于传统文化浓厚的省份”作为个人迷信倾向的工具变量,这种地区层面指标能明显降低内生性争议。

2.2 公司层面的迷信行为:代码、日期、分红数字

公司层面的标签解决的是“行为结果”的问题。股票代码本身由交易所分配,公司一般没有选择权,但代码末尾数字会在投资者心中产生长期暗示,例如尾号8和6被认为是吉利数字,尾号4被认为不吉利。公司在上市时虽然不能挑代码,却能挑上市日期,所以我把IPO公告日、招股书发布日期、上市日期都单独存下来,并标注是否落在传统历法里的“黄道吉日”或“宜交易”日。

分红行为和融资行为也值得记录。A股有一些公司特别喜欢把单股分红金额定成0.88元、1.28元、2.88元这样带8的数字,还有一些公司在定增融资时选择“世故”的价格区间,这些都符合迷信数字偏好的特征。把这些内容记成离散标签比记录连续数字更有用,例如“分红金额是否以8结尾”“增发价格是否含整数8”“并购公告日是否选在农历逢八的日子”。第三类行为是高管换届,上任日期本身就是可以择时的,临近传统节日、节气甚至祭祀日期的上任行为,都可以转换成一个时间距离变量。

2.3 综合迷信浓度的合成指标思路

字段拆完以后,不少朋友会直接拿单个变量跑回归。实际上单变量容易受噪音干扰,我建议构造一个“迷信浓度指数”。思路不复杂:把个人层面的生肖冲突、犯太岁、姓名数理高分、出生地迷信强度,和公司层面的代码尾号、公司名吉字、择时行为各自标准化,然后按分析师给定的权重加总。权重可以采用等权,也可以用主成分分析来提取第一个主成分。

合成的目的是把多个弱信号合并成一个强信号。比如单独看“CEO的名字笔画是否吉利”,可能对投资决策没有显著影响;但把“CEO名字吉利、出生地迷信强度高、公司代码尾号为8、IPO吉日上市”四个特征放在一起,得到的综合指标就具备更稳定的解释力。合成之后不要忘了做几个不同的版本:激进版只保留个人标签,保守版只保留公司行为标签,完整版两者都保留。后面做稳健性检验时,这些版本之间的一致性会非常有说服力。

3. 数据采集与真伪辨别的实操过程

3.1 样本范围的圈定与时间拆分

第一步先圈定总体样本。A股上市公司包括沪深主板、创业板、科创板,北交所如果条件允许也可以单独保留。这里要特别注意退市公司和ST公司的处理——很多初学者只保留当前存续公司,这会造成严重的幸存者偏差。正确的做法是从历史快照出发,将2008年至2025年间曾经出现在市场上的所有公司全部纳入,再把退市和暂停上市标记为状态字段,由后续研究人员自行筛选。

时间上我建议把更新频率设置为年度档,每年生成一份快照表,记录该年度在任的董事长、总经理、财务总监和董事会秘书,形成“企业-年度-高管姓名-职务”的长表。这样后续计算本命年效应时,可以精确判断某位CEO在特定年份是否处于本命年。如果想把事件做得更细,可以进一步拆成季度档,但季度档的人工校验成本会成倍增加,除非你要做季频投资因子,否则年度档已经够用。

3.2 高管个人信息从哪些渠道拿最靠谱

高管的出生日期、籍贯、学历等信息,主要来自招股说明书、年度报告的高管简历部分和上市公告的任命文件。其中招股说明书的简历信息往往最完整,一段典型文本长这样:“王某某,男,1975年11月出生,中国国籍,无境外永久居留权,硕士研究生学历,历任XX公司财务总监……”这段文本里包含了出生年月、性别、姓名三个核心字段,解析价值极高。

更高级的做法是利用交易所信息披露平台的PDF公告做一次批量抓取,再配合CSMAR和Wind的高管数据库做交叉验证。我实际用的流程是:先用文本解析工具把PDF转成结构化文本,再用正则表达式从简历段中提取出生年月和籍贯信息,最后和商业数据库的高管明细表做逐字段比对。遇到商业数据库有但公告缺失的,以公告为准;遇到两边不一致的,单独打上“异常”标记并人工复核。

这里必须提醒一点:不要依赖搜索引擎里高管百科词条上的出生日期。有些词条信息是粉丝或编辑者根据公开资料推的,和官方披露存在偏差,尤其是生辰八字这类敏感字段,做学术研究时一旦用错,整个结果都会失真。所有出生信息必须追溯到公司公告原文,才能进入正式表。

3.3 缺失信息与填补的土办法

出生日期缺失是最大的坑。早年公告经常不写具体日期,只写年龄或学历信息。遇到这种情况,我通常按“保守填补”和“区间推定”两套逻辑处理。保守填补就是直接标为缺失,不参与生肖和八字计算;区间推定则是根据身份证号码前六位无法确认时,结合任职年龄倒推一个出生年份范围,再在范围内取概率最高的年份。

区间推定只适合大样本统计,不适合个体精确判断。比如高管简历写“现年48岁”,任职公告发布年份是2015年,可以推断出生年份大约在1966-1967年之间;如果同时能确定月份信息,就可以进一步缩小范围。把所有推定数据打上“推断”标记,最后做回归时分别用“仅使用精确生日样本”和“包含推断样本”两组跑一遍,结论方向一致才敢使用。还有一个土办法:利用工商系统公示的董事信息去补充部分高管的年龄字段,虽然不能直接得到生日,但至少能确认年份。

4. 清洗、匹配与质量控制:我踩过的坑

数据从公告落到表格,中间大概要经历三轮清洗。第一轮整理原始字段,第二轮做跨库匹配和去重,第三轮做一致性检查和合理性检验。这三轮里每一轮都有值得记录的细节,我挑几个最典型的展开。

4.1 重名、改名和“同名不同人”问题

高管重名在A股并不罕见。名字相同的两个人,一个在A公司做董事长,一个在B公司做独立董事,简单按姓名去重就会误伤。我的做法是构造“姓名+出生年月+性别”三维键,能匹配上再判定为同一人。如果只有姓名没有出生年月,宁可当作两个人分别保留,也不要强匹配。还有一种情况是高管在任期内改过名,早年公告用旧名,近年公告用新名,需要在备注字段里记录曾用名,并把曾用名和现用名关联到同一个人工ID下。

清洗重名最好的工具是生成每个高管唯一的person_id。这个ID可以按“姓氏拼音首字母+姓名全拼+出生年”的规则生成,但不要用它做精确主键,因为拼音重名率依然不低。真正可靠的方法还是人工抽查:从样本中随机抽200条记录,逐一核对公告原文,把核对结论做成一张“身份确认表”。200条看起来不多,但已经能发现一些系统性问题,比如某一年份数据整体存在偏倚。

4.2 生肖和出生年份的换算陷阱

生肖看起来是最简单的字段,实际上最容易出错。很多人直接用公历年份套生肖表,比如1990年2月3日出生的人,会按公历算成属马;但按传统干支纪年,立春前后出生的人,上一个节气还没过,属相仍然是蛇。标准做法是以立春节气为分界,而不是农历正月初一。我见过不止一篇论文在这个细节上翻车,最后结论被审稿人质疑。

我写过一个简单的换算函数,你可以直接在构造数据集时用:

import datetime # 立春日近似按2月4日处理;严谨场景请查天文台节气表 def ganzhi_year_from_date(dt: datetime.date) -> int: if (dt.month == 2 and dt.day >= 4) or dt.month > 2: return dt.year else: return dt.year - 1 def zodiac_from_date(dt: datetime.date) -> str: z = ["鼠","牛","虎","兔","龙","蛇","马","羊","猴","鸡","狗","猪"] y = ganzhi_year_from_date(dt) return z[(y - 4) % 12] # 示例:1990年2月3日,按此函数应属蛇 print(zodiac_from_date(datetime.date(1990, 2, 3))) # 蛇

容易忽略的还有一点:有些数据源里的“出生年份”是身份证号码的登记年份,不一定是真实出生年份。身份证重号、错号、登记延迟都会导致推演的生肖不准确。保险起见,我专门加了一个“出生信息置信度”字段,当公告明确写到完整出生日期时记为高置信,只有年份时记为中置信,完全靠年龄推算时记为低置信。

4.3 跨年度、跨库匹配的细节

高管身份在不同年份之间保持稳定,但并非绝对稳定。同一个“陈某某”在2015年年报里是财务总监,到2018年可能变成了总裁,源文件名称和职位变化会导致匹配失败。我更推荐先建立“人-职-年”长表,再把财务数据和治理数据以公司代码和年份为主键左连接,而不是直接尝试在高管层面做横向匹配。

CSMAR的年度高管表里通常有“任职起始日期”字段,这个字段必须严格保留。研究迷信效应时,很多人会误以为公司当年年报披露的高管代表当年整年都在任,但实际上有些高管是12月才上任的,把全年业绩归因于他会造成偏差。我的做法是设置一个“当年任职天数占比”字段,超过半年的才算完整任职,低于半年的在稳健性检验时打折处理。

4.4 一致性检验:迷信指数会不会只是噪音

清洗完的数据,先别急着喂模型。我会先做三个快速检查。第一,生肖分布是否均匀:正常情况下,12个生肖在全体高管里的分布应该大致均衡,如果某一个生肖明显偏多,可能是出生年份解析出了问题。第二,姓名笔画分布是否有极端值:如果出现大量笔画数为0或负数的记录,说明字库映射失败了。第三,本命年标志和出生年份逻辑是否自洽:样本里每个高管的多个本命年年份,都应该相差12的整数倍,一旦发现年份差不是12,说明干支换算有bug。

做完一致性检查后,再对“迷信浓度指数”做一次替换检验:把繁体笔画改成简体笔画,把立春分界改成农历正月初一分界,把工具变量地区强度换一个构造口径,分别看结论是否仍然成立。这一轮替换不要求数值完全一致,但符号方向和显著性不能发生反转。如果反转,就说明原指标本身太脆弱,需要回溯找原因。

5. 这套数据能支撑哪些分析:从假说到执行

数据整理到这个程度,真正有趣的分析才刚刚开始。我见过很多朋友拿着一套新数据不知道从哪里下手,这里提供一个我的分析路线,从简单到复杂逐层推进。

5.1 本命年效应与企业风险承担

这是最容易上手也最容易出结果的方向。基本假说是:处于本命年的高管,因为“运势焦虑”,会减少高风险决策。可以用资本支出率、研发费用率、有息负债率作为风险承担的代理变量,以高管是否处于本命年作为核心解释变量,同时控制公司规模、上市年限、产权性质、行业和年份固定效应。

实际操作时,可以构造一个12年周期的滚动对比:把每个高管的任职年限映射到本命年距离变量d上,d=0表示正处于本命年,d=-3表示本命年前三年,d=3表示本命年后三年。然后用事件研究法画出不同d值对应的平均资本支出率,观察d=0处是否出现明显的凹形。这个图做出来,比单纯跑回归更有冲击力,也更容易在论文里讲清楚故事。

5.2 吉日择时与并购、IPO公告的市场反应

第二个方向是把择时行为作为研究对象。典型做法是:把并购公告日、资产重组首次披露日按老皇历的宜忌标注成“吉日”和“平日”,再比较事件窗口内的累计超额收益率。假说有两种:一种是公司特意选吉日发布消息,市场会因为信号效应给出更高反应;另一种是迷信择时本身不创造价值,投资者逐步识别后反应反而更低。两种结果都有发表价值,关键是把“吉日”定义写清楚。

择时行为不仅限于并购。IPO发行日期、限售股解禁日期、业绩预告发布时间,都可以生成对应的吉凶标签。研究时要注意节假日效应:临近春节、中秋的公告经常夹杂节日情绪,不能简单归因于择时。我在生成事件日历时,会额外添加“是否临近传统节日”“是否周五下午”“是否下午收盘后”三个辅助变量,用来做安慰剂检验。

5.3 把迷信倾向作为工具变量

这是计量上更进阶但更有说服力的用法。研究“CEO风险偏好→企业创新投入”这类问题,会遇到严重的内生性:风险偏好既影响创新投入,也可能反过来被创新业绩影响。这时候可以用“CEO出生地迷信强度”或“CEO姓名笔画吉凶”作为个人风险偏好的工具变量,因为姓名和出生地是先天的,不直接受公司绩效影响,但很可能通过传统文化塑造了个人风险态度。

用这套数据做IV时,有几条必须严守的规矩。第一,工具变量的相关性必须足够强,先跑一阶段回归,F值一般要求大于10;第二,排他性要讲清楚逻辑,出生地迷信强度为什么只能通过风险偏好影响创新,而不能直接决定公司创新政策;第三,换不同版本的迷信强度指标重复一遍,证明结果不是特定构造方式带来的巧合。大数据集虽然给出很多可能性,但千万不能把所有可能的结果都拿去筛一遍,这样容易落入“看着显著去讲故事”的陷阱。

5.4 事件研究法和面板回归的落地提示

具体实现时,我个人建议分四步走。第一步,把长表按“公司-年度-高管”拆成面板结构,每个人保留一条年度记录;第二步,在Stata或Python的linearmodels里设定公司层面的聚类稳健标准误;第三步,分组做异质性检验,比如区分国有和非国有、区分东部沿海和内陆地区;第四步,把结论放入安慰剂检验环,比如随机打乱生肖标签1000次,看真实估计值是否处于随机分布的尾部。这四步走完,文章的分析框架基本就立起来了。

6. 常见问题速查与数据使用建议

数据使用过程中,最容易出问题的往往不是技术实现,而是细节口径。下面这张速查表整理了我在整理和使用这套数据时反复踩过的坑,你可以直接当操作手册用。

问题我的解决办法特别注意
公告里只有年龄没有出生日期从任职时间倒推年份,打上推断标记年份区间超过两年时不做生肖标签
高管姓名重名用“姓名+出生年月”联合匹配不要用姓名做唯一主键
生肖周期按春节还是立春统一按立春节气确定干支年春节出生但未到立春者,属上年生肖
姓名笔画简繁不一致繁体康熙笔画为主,简体笔画做替换检验两个版本都保留在字段里
缺少退市公司数据从历史快照补全退市样本只保留存续公司会严重偏差
高管年中离职或上任记录任职天数占比,占比过低单独标记不要用年初年末简单判定
抓取的PDF文本错位人工抽查200条记录核对正则解析结果必须回抽验证
跨库匹配后重复记录用公司代码+年份+person_id去重保留每个来源的原始主键
数据是否可以作为投资建议不能,仅用于研究参考发表或商用前咨询合规意见

每次发布数据集版本时,除了数据表本身,至少要附带三份说明文件:字段字典、清洗脚本版本记录、抽样核对记录。我在最终交付时会把这三个文件放进同一个目录,和核心数据并列保存。很多研究员拿到数据集后只看主表,不看文档,但真正决定数据质量的恰恰是文档里标注的每一个边界条件。

关于隐私和合规,这里也多说一句。高管出生日期、籍贯、学历都是公开披露信息,可以合法采集,但使用时要限于学术研究和统计分析,不能用于个人身份画像、骚扰或其他不当用途。发布衍生数据时,建议把精确出生日期归并为出生年份或生肖级别,只保留基于公开信息整理后的结构化字段,减少个人信息暴露面的同时,也让数据更容易通过合规审查。

提示:不同数据库对公司高管的定义范围并不完全一致。我做数据时默认“高管”包括董事、监事和高级管理人员,但也单独保留了一张只含CEO/董事长/财务总监的简表。如果你后续研究关注的是“关键少数”决策层,使用简表比使用全量高管表更合适。

最后分享一个我自己在实际操作中反复确认过的经验:不要小看“立春”这个细节。数据集第一版我简单按公历2月4日划界,后来换成天文台精确节气表,发现样本里有将近3%的高管生肖被划错了。本命年回归的系数本来不明显,修正之后竟然变得显著。这件事给我的教训是:处理民俗类字段时,计算口径的统一比样本量大小更重要。如果你拿到这份数据,建议先把“本命年如何定义”这条规则和你的合作者对齐,再开始跑任何回归。后面遇到的绝大多数争议,到最后都会回到口径问题上来。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询