最近和鹏华基金量化团队的苏俊杰做了一次深度交流,主题是“营建‘AI+’基本面量化投资体系”。去之前我预期会听到一堆模型和因子,聊完之后发现他更强调的是“体系”两个字。数据怎么清洗、因子怎么生成、信号怎么变成仓位、仓位怎么被监控,每一步都嵌入了AI能力。现在市面上聊“AI+写代码”“AI+前端开发”“AI+后端开发”“AI+开发实战”的人很多,但把这些工具真正放进一个基本面量化的生产管线里,让AI不只停留在单点炫技,是一个更值得讨论的问题。这篇文章把我从访谈中提炼到的核心逻辑,和我自己多年搭量化系统的经验放在一起,做一次系统拆解。适合正在搭量化投研体系的从业者参考,也适合想从传统主动研究转向量化的人作为路线图来读。
1. “AI+基本面量化投资体系”到底在搭什么:先看全貌
1.1 为什么偏偏是“基本面+量化”,而不是单打独斗
主动研究和纯量化这两条路,长期是分开走的。主动研究员擅长深挖一家公司的产业逻辑、管理层质量、商业模式,但覆盖范围有限;量化模型擅长在海量标的上做回测、统计、执行,但容易忽略商业常识,做出一个统计上显著但逻辑上讲不通的因子。
“基本面量化”想解决的就是这个割裂问题。它先把主动研究里那些公认有效的逻辑,比如“业绩超预期”“盈利质量改善”“管理层增持”,转化成可以用数据度量的特征,再通过量化模型在全球几百上千只股票上同时计算并验证。这等于把优秀研究员的分析框架变成了一条可复制、可追踪、可回测的生产线。
苏俊杰在交流中提到一个关键判断:基本面量化不是要去替代主动研究员,而是要把他们的判断过程“结构化”。主动研究员看完一份财报能形成“这家公司超预期”的结论,量化系统则要把这个结论拆解成“实际值和一致预期的差幅”“盈利修正的方向”“事件发生的时间窗口”等若干可计算变量。人的认知变成因子逻辑,机器负责在更大范围内执行,这样才能让投研团队的产能不再被单人日覆盖量锁死。
1.2 完整体系分四层:数据、因子、组合、风控
“体系”这个词听起来虚,落到系统上其实是清晰的分层架构。一套完整的基本面量化投资体系大致包含四层,各层之间有明确的数据接口和职责边界。
| 层级 | 核心任务 | AI+的主要介入点 |
|---|---|---|
| 数据层 | 把财报、公告、研报、会议纪要等原始信息结构化 | NLP实体识别、事件抽取、知识图谱、文本情绪打分 |
| 因子层 | 从结构化数据中生成收益预测信号和风险暴露 | 机器学习特征工程、因子挖掘、模型训练 |
| 组合层 | 在风险约束下把信号转为真实持仓权重 | 优化器、风险模型、协方差预测 |
| 风控层 | 监控组合暴露、回撤归因、交易异常 | 实时监控、绩效归因、自动化预警 |
这套分层不是新鲜发明,很多主流量化机构都这么搭。AI+进入之后,真正的区别在于,每一层都不再是孤立的流水线。数据层抽取出来的“管理层增持”字段,能直接输送到因子层的模型中;因子层训练出的预测结果,又会进入组合层的优化器;风控层再把实时结果反馈回因子层做模型修正。这个闭环是“体系”区别于“一堆脚本”的核心标志。
对刚开始搭建的团队,我通常建议先别追求四层都很完整。哪怕先搭一个“数据+NLP因子+简化组合”的最小闭环,也比零散地写几个选股模型有用得多。体系的价值在于,每一次研究的产出都能沉淀下来,被下一次使用,而不是人走模型散。
1.3 为什么现在必须加“AI+”:成本、数据、工具三条线
很多年前基本面量化就已经存在,但当时的实现方式很原始:人工定义财务指标,用线性回归做打分,再用Excel或者简单的内部工具做回测。这条路能跑,却跑不快。
现在加上“AI+”,提升来自三条线。第一是数据成本大幅下降,算力和数据存储比十年前便宜了一个数量级,公司有实际条件去处理过去完全不可能处理的非结构化文本。第二是数据本身变多了,光靠人工读研报和公告已经覆盖不过来,必须借助NLP工具做信息抽取。第三是工程效率工具爆发,“AI+编程”“AI+自动化办公”这类工具直接降低了搭建系统的人力门槛。
这三条线叠起来,使得“AI+基本面量化”已经不是要不要做的问题,而是怎么做得比别人快的问题。过去一个研究员一周只能精读十份年报,现在用AI抽取关键字段,一天能覆盖几百家公司的核心事件;过去一个新因子从想法到上线要半个月,现在配AI编程助手,两三天就能出原型。这种效率差异会直接反映在投资组合的信息处理速度上。
2. AI如何把财报和公告变成可交易的信号:自然语言处理实践
2.1 原始文本到结构化因子的标准流水线
基本面量化最大的数据瓶颈,不是三大财务报表,而是大量非结构化文本。管理层讨论、业绩说明会纪要和新闻报道里,藏着的有效信息通常不比报表少。把这些文本变成AI可计算的因子,需要一条标准流水线。
我实际验证下来比较稳定的处理路径是:先做文本采集和清洗,把公告、研报、新闻从不同数据源归一化成统一格式,这一步最麻烦的其实是PDF误识别和表格错位,不能在起点省力。接着做实体识别,把公司名、人名、股东名、产品名对应到标准主键。再往下是事件抽取,判断“这是增持公告、回购公告还是业绩预告”,把关键金额、比例、时间窗口一并抽取出来。最后是语义层面的处理,判断事件的性质和语气。
这条流水线很成熟,但真要落地,细节决定成败。我在项目里见过最多的翻车情况,就是把图片型公告直接拿来跑模型,结果内容几乎全乱。所以OCR的置信度检查、段落结构还原、关键字段的二次校验,都是不能省略的环节。做抽取模型时也可以用OCR+领域微调,但先要保证OCR层面不丢字。
2.2 从“事件”到“预期差”:两个最值得优先做的信号
处理完文本后,自然要回答一个问题:哪些提取出来的信号真正对收益预测有帮助。从基本面量化角度看,最值得优先做的信号是“事件”和“预期差”,而不是简单的“利好利空”。
事件信号比较好理解。比如某公司发布了重要股东增持公告,这个事件本身代表了一种内部人的判断;公司回购、管理层高额增持,这类行为的可信度和信息披露的约束性都比较高,天然带有alpha信息。把“是否有事件”“事件类型”“事件强度”三个维度做成结构化字段,就能形成一批可解释性很强的因子。
预期差信号则更贴近传统的盈利预测逻辑。真正推动股价的不是“业绩好”,而是“业绩比市场预期的好多少”。AI可以自动读取业绩预告、分析师的盈利预测调整,计算实际值与一致预期的偏差程度,再生成预期修正因子。这类因子的逻辑很硬,从业者对它的接受度远高于纯机器学习黑箱因子。
在访谈中我印象较深的一点是,苏俊杰认为要优先选“语义确定性”较高的信号,而不是一上来就做开放式的情绪识别。情绪分数听起来前沿,但噪声极大;增持比例、预期差幅这类信号是可核实的硬信息,两者在实盘里的表现差距非常明显。
2.3 LLM再能干,也要留人工校验样本
大语言模型(LLM)流行之后,很多人直接用LLM跑研报摘要和公告情绪分析,看起来效果好,但有一个隐患:LLM的抽取结果不稳定,同一个段落换一个输入顺序,结果可能不同。用在研究辅助上无所谓,用在实盘信号上就是大事。
在AI+基本面量化的体系里,我的习惯是对所有文本抽取结果留下一批人工校验样本。每跑完一批新数据,抽几百分之一的结果让研究员看一遍,标注错误类型,然后定期反馈成训练数据。这一层“人在回路”设计看着笨,但能防止系统性漂移。
另外要特别注意事件时间戳。公告的发布时间和实际影响市场的时间不一定一致,有些公告在盘后发布,有些在盘中临时停牌后发布。如果一个事件被错误标注到前一天,回测结果会严重失真。这个细节比模型本身更值得投入时间。
3. AI+编程重塑量化投研工具链:从写代码到自动化办公
3.1 AI编程助手把研究员的“想法”变成“代码”
现在讨论AI+编程已经不是趋势问题,而是日常操作。量化投研团队尤其明显,因为这里的本质工作就是“把想法变成可执行的回测代码”。过去这件事依赖工程师排期,研究员提需求、工程师写代码,沟通成本很高。现在有了AI编程助手,研究员自己就能完成大部分原型开发。
我自己用下来的模式是:研究员先用自然语言描述“我想做一个业绩预告超预期因子,数据来源是A表,过滤条件B,输出信号C”,AI编程助手生成第一版pipeline,然后由工程师做代码审查和性能优化。设计优良的话,这个过程把“需求沟通—排期—开发—联调”压缩成了“描述—生成—审查—修改”四个短环节。
这里有一条必须守住的红线:AI生成的代码绝不能直接进实盘。我在实际项目中遇到过AI“一本正经写错字段”的情况,比如把同比增长算成了环比增长。所以无论生成多快,代码审查和单元测试都不能省略。AI负责把整体骨架拉出来,人负责把正确性钉死。
3.2 前端与后端都在AI化:投研平台的工程改造
很多人以为量化投研平台只是写模型,实际上一个能支撑“AI+基本面量化”体系的平台,包含清晰的前端、后端和基础设施。AI+前端开发在这里能发挥很大作用,监控面板、因子看板、回测曲线展示,这些界面需求长期被投研团队低估。
后端开发的AI化同样重要。数据API、因子注册服务、策略生命周期管理、任务调度系统,这些模块如果用传统方式写,工作量巨大。用AI辅助生成标准CRUD接口和任务框架,再配合统一字段字典,可以大幅度缩短开发周期。我见过一些小团队用AI编程工具,在几周内就搭建出原本要两个后端工程师开发三个月的内部系统。
这里我想给一个实际建议:平台开发不要追求大而全。先把“数据接入—因子计算—简单展示”这条主链路跑通,再迭代加功能。AI+开发实战的价值,前提是工程规范清晰。没有规范,AI生成的代码越多,后续维护越痛苦。
3.3 报表、纪要、问数:AI+自动化办公的三个落点
AI+自动化办公这个词听起来像行政效率工具,但在量化投研体系里,它对应的是三个高价值场景。
第一个是定期报告生成。组合周报、月度归因报告,这些内容有固定模板,但数字需要从系统实时拉取,文字描述要跟随数据变化。用AI把这些数字串成可读的分析段落,再由研究员审阅,能省掉大量重复劳动。
第二个是会议纪要。业绩说明会、投研晨会、基金经理复盘,每一场会议的信息浓度都很高。AI生成纪要和待办,让研究员可以把注意力放在内容判断上。
第三个是智能问数。建立一套“自然语言查询数据”的能力,比如“这周三组合里有多少家公司上调了盈利预测”,AI先转成SQL,再调底层数据,最后用自然语言回答。这个能力会极大降低团队协作门槛,让非工程背景的研究员也能直接和系统交互。这些AI+工具不会直接产生alpha,但它们让团队更频繁地使用数据,间接提升投研效率。
4. 从信号到组合落地:回测搭建与防“自欺”的方法
4.1 把Alpha信号变成仓位:组合构建的约束条件
单模型在样本里选出一堆股票,不意味着可以直接照着买。这个环节要做的是把信号转化成一组符合约束的持仓权重。组合优化器会输入预期收益信号和风险模型,然后在行业偏离、个股权重、换手率、流动性等约束条件下,求解一个风险收益最合适的组合。
基本面量化体系和纯量化的差别在于,它通常不追求极致的收益最大化,而是追求“信息比率更稳”。原因很简单:基本面信号本身蕴含逻辑,但它的覆盖频率和调整周期偏慢,组合如果换手过高,交易成本会把alpha吃光。所以优化器里换手约束和成本模型极其重要。
对于刚起步的团队,我建议先别急着上大规模机器学习协方差模型。用传统的多因子风险模型,把行业、市值、风格暴露控制住,先把组合做稳定。等到数据积累够了、团队理解了风险来源,再引入AI做协方差预测或非线性优化,这样更稳妥。
4.2 回测中最容易踩的五个“脏数据”问题
回测是量化体系里最容易被“自欺”的环节。表面上看跑得很漂亮,实盘却完全不是那么回事,绝大多数问题出在数据上。我整理了五个最常踩的坑:
- 前瞻偏差:用了当时根本没有的数据点,比如用“后续公布的年度净利润”去回测当年因子。
- 幸存者偏差:股票池只保留了当前还在交易的股票,退市和表现极差的股票被无声剔除。
- 复权处理不当:没有正确处理分红送转,导致价格序列出现不真实的跳空。
- 交易假设过于理想:忽略涨跌停买不进去、忽略冲击成本和滑点。
- 参数调优过拟合:在同一个数据集上反复试参数,直到回测曲线变得完美。
应对的核心思路是“从头到尾模拟真实约束”。所有特征只能使用调仓日前已经可得的数据,股票池用历史时点的成分,交易假设按极端情况的成本来测算。只要回测路径和真实路径保持严格一致,结果才有可能外推。
提示:建立一条规则,任何特征字段都要带“数据可得时间戳”,而不是只带“财报期”。财报期不等于数据发布时间,很多财报实际公布日和截止期差很久。这条规则能挡住大部分前瞻偏差。
4.3 因子衰减了怎么办:建立模型更新机制
没有任何因子能一直有效。市场风格变化、投资者结构变化、制度环境变化,都会让曾经显著的基本面信号逐渐钝化。问题不是“会不会衰减”,而是“怎么发现衰减并处理”。
一个健康的体系需要日常监控因子IC、IR、换手率、多空分组的超额收益曲线。当因子IC连续若干期显著下滑,或者多空收益变窄,就要触发复核流程。复核的方向包括:是数据口径变了,是市场风格暂时漂移,还是因子逻辑已经被充分定价。
AI在这个环节可以承担“异常预警”工作。系统自动给因子做体检,做对比分析,再用LLM生成一份可读的因子变化说明,让研究员快速判断该调整还是该停用。这比每天面对一堆数字更符合人的决策习惯。因子上线的生命周期也不能是一次性的,而是要像软件一样有版本、有迭代、有下线机制。
5. 新手必看:常见问题与避坑实录
5.1 过拟合和特征泄漏:最隐蔽的两个雷
我见过很多新团队做“AI+基本面量化”,第一版模型回测收益惊人,实盘却亏损,最常见的原因就是特征泄漏和过拟合。这两个问题藏得深,短期内甚至看不出异常。
特征泄漏的逻辑很简单:一条本应在未来才出现的信息,被提前塞进了当前特征。比如直接用“当年年报”的整年净利数据去预测当年下半年的收益,看起来上市值有先见之明。避免泄漏的办法是严格依赖“可得性”,数据快照里有什么,就用什么;不要在这个文件和历史序列之间做跨越时间的连接。
过拟合则容易发生在参数调整过程中。模型复杂度过高,参数多到能记住历史噪声。应对策略包括:控制特征数量、使用更简洁的模型结构、做滚动窗口验证。我的经验是,基本面量化场景优先用线性模型或浅层树模型,效果通常不输深度模型,而且可解释性更好。模型越简单,越容易在样本外保持稳定。
5.2 让“黑盒”变“白盒”:AI模型的可解释性
不论系统多先进,最终拍板下单的依然是投资经理。投资经理天然不愿意把钱押在自己不理解的黑盒上,所以AI+基本面量化体系里,“可解释性”不是一个加分项,而是一个生存条件。
实操中,我会对每个AI因子做归因拆分,用特征重要性、SHAP值、分组表现等方式,说明这个因子在什么环境下有效,在什么环境下无效。然后按基本面逻辑给AI因子分组,比如分到“盈利质量组”“预期修正组”“事件驱动组”,让每个组都能被传统意义上的投资逻辑解释。
还有一条我认为最重要的规定:无法解释的因子不上线。即使回测收益再高,如果没法说明白它赚的是哪部分钱,就不进入实盘组合。这个约束会倒逼研究员在做特征工程时保持谨慎,也让我们后续的模型信任度维持在一个较高水平。
5.3 “AI+”不是替代研究员,而是放大研究员
“AI+基本面量化体系”要搭建成功,最难的根本不是技术,而是团队分工和认知更新。AI+编程、AI+前端开发、AI+后端开发、AI+自动化办公,这些工具释放的其实是研究员的非核心精力,让研究员更多投入到“定义问题”和“理解结果”上。
在访谈中苏俊杰也提到一个观点:量化团队真正的竞争力,很多人以为是数据和模型,其实是“把投研逻辑转化为数学语言”的能力。AI可以加速转化过程,但逻辑本身来自人对产业、公司和商业模式的理解,来自那些不能被代码替代的直觉。
所以团队配置上,最理想的组合是:有人懂基本面研究,有人懂工程化开发,还有人懂统计建模;AI把三者之间的协作摩擦降到最低。研究员提交一套逻辑,工程师和AI把它变成可复用的模块,然后再由研究员验证模块是否符合商业直觉。AI在这里是放大器和加速器,不是替代品。
6. 最后分享一个搭建“AI+”体系的小技巧
如果你所在的团队条件有限,没法一次性把数据、因子、组合、风控四层完整搭起来,我建议先选一个特别具体的基本面场景作为突破口。比如“业绩预告超预期”或者“重要股东增持事件”,先把这一两类数据从文本到因子、从因子到组合的闭环跑通,哪怕范围很小,体系标准也要按生产级来做。
我自己的体会是,小闭环最大的价值在于“可复制”。第一段跑通之后,第二个场景、第三个场景会越来越快,因为数据规范、事件抽取流程、回测框架和团队协作方式都已经沉淀下来。反过来,如果一开始追求大而全,很容易陷入工程泥潭,几个月过去看不到一个能说服投资经理的产出。
另外建议把“数据可得时间戳”当作地基纪律来抓。AI+基本面量化不同于纯统计量化,它的信号来源复杂、更新节奏不规律,时间语义一旦出错,后续所有因子和组合都会跟着出错。一个体系是否可靠,往往不体现在模型多复杂,而体现在这些基础规则有没有被执行到底。