基于中文大模型的金融事件抽取:从财经新闻到股价预测的搭建指南
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
面向想搭建金融事件抽取系统的新手,本文介绍如何用中文大模型从财经新闻、财报与社交媒体中,抽取并购、高管变动、财报发布等事件的主体、时间与影响,并将结构化事件数据接入股价预测与量化交易流程。
人工盯盘的瓶颈:事件流读不过来
假设你负责一只个股的舆情监控。一条"公司 A 拟收购 B 业务"的公告,从发布到股价反应往往只有很短的窗口,而每天流入的财经新闻以百计。靠人眼判断哪条构成事件、主体是谁、何时生效,既覆盖不全,也无法量化。金融事件抽取系统搭建的第一步,是把这类非结构化文本变成统一的结构化记录:每条事件包含类型、主体、时间、影响四个字段。
方案如何工作:财经新闻事件要素抽取流水线
流水线分三步,语义理解全部交给中文大模型完成:
- 事件检测:判断一条文本是否属于并购、高管变动、财报发布等预定义事件类型;
- 要素抽取:输出事件主体(哪家公司)、发生时间、对象或金额等关键槽位;
- 情绪与影响打分:给出正面/负面标签和影响强度,作为下游股价预测的特征。
以"XX 公司发布三季报,净利润同比增长 12%"为例,抽取结果形如 {type: 财报发布, subject: XX 公司, time: 2026-08-30, impact: 正面}。之后任何策略都只消费结构化字段,不再依赖原始文本。
模型怎么选:FinGPT、BBT-Fin 与轩辕的取舍
仓库整理了金融方向的开源模型,参数与成本明细见 doc/Financial.md。选型主要看两点:基座规模与训练成本。
| 模型 | 基座 | 训练成本 | 适合场景 |
|---|---|---|---|
| FinGPT | ChatGLM-6B / LLaMA-7B + LoRA | 约 300 美元/次 | 快速验证事件抽取原型 |
| BBT-Fin | FinT5 0.2B / 1B | 低 | 私有化部署、低算力环境 |
| 轩辕 XuanYuan | BLOOM-176B(含 7B 版) | 8 卡 A100 80GB | 对话质量要求高、算力充足 |
建议从 FinGPT 起步:LoRA 微调成本低,且其数据覆盖新闻、社交媒体、财报三类源,与事件抽取任务对齐度较高。BBT-Fin 附带 BBT-FinCorpus 语料库(Base 4GB / Large 16GB)和 CFLEB 评测集(FinQA、FinRE 等),适合做基线对比。
数据怎么接入:从 Reuters 到雪球的四类源
按信息形态分四类,建议先离线跑通,再上实时源:
- 财经新闻:Reuters、CNBC、Yahoo Finance、东方财富、新浪金融、36氪、虎嗅;
- 社交媒体:Twitter、新浪微博、雪球、东方财富股吧;
- 公司财报:SEC、证券交易所官网;
- 趋势数据:Seeking Alpha、Google Trends。
接入顺序上,先拿几百条静态新闻样本做要素抽取的字段完整率统计,达标后再接一个实时源做 7x24 监控;社交媒体噪声大,建议放到第二阶段,配合 FinFE 这类金融情绪分类数据集单独调优。
落地场景:用事件特征做股价预测
以单只股票为例:维护一条事件时间线,每个事件在时间戳 t 上写入类型、主体、情绪分与影响强度,基于大模型的股价预测模型把事件序列与行情序列对齐后训练。评测可直接用貔貅(PIXIU/FinMA)指令微调中的股价变动预测数据集 BigData22、ACL18、CIKM18。两个常见坑:一是事件发布到股价反应存在滞后,特征要按可获知时点回填,避免未来函数;二是事件是稀疏信号,需与量价特征组合,单靠事件类型做预测通常不稳定。
快速跑通:3 步搭出第一个抽取原型
- 拉取仓库,按 doc/Financial.md 找到 FinGPT 对应的模型与数据条目;
- 准备 50 条并购、高管变动类新闻,写一条提示词,要求模型输出 {类型, 主体, 时间, 影响} 四字段 JSON;
- 人工抽检 20 条,统计字段完整率;高于 90% 再接入行情数据做回测。
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cat doc/Financial.md原型跑通后,优化方向按优先级排序:扩大样本量、接入财报源、补充影响强度分级。事件抽取的字段结构一旦稳定,下游股价预测与量化策略的改造成本就很低。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考