摘要
本文解读 IEEE Access 2025 论文《基于大语言模型的地震应急信息知识图谱构建与应用》(Research on the Construction and Application of Earthquake Emergency Information Knowledge Graph Based on Large Language Models)。该论文聚焦地震应急信息知识图谱的构建与应用,提出面向地震应急的领域知识抽取方法 TPES-LLM,通过融合三层提示工程(指令微调—需求感知—案例匹配)、双向图注意力网络 Bi-GAT与路径置信度约束算法 PCCA,把震后微博、微信、新闻与震害报告等多源异构文本抽取成 RDF 三元组,并在Neo4j中构建可查询、可推理的应急知识图谱,其特别之处在于把大模型的知识注入与图结构上的可靠性推理连成闭环,而不是停留在一次性抽取。实验表明实体识别 F1 达 0.9152、关系抽取 F1 达 0.8824,均超过 BiLSTM-CRF 与通用大模型基线,三个真实震例的图谱问答 Hit@1 分别为 0.8962、0.8728 与 0.9023,响应时间全部低于 2.5 秒,为灾害应急信息化与领域知识图谱建设提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- 这篇论文的核心方法 TPES-LLM 是什么?
- 它和直接用大模型做信息抽取有什么区别?
- Bi-GAT 与 PCCA 分别解决什么问题?
- 知识图谱最终能做什么?
- 论文的数据规模有多大?
- 引用论文数字时需要注意什么?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Research on the Construction and Application of Earthquake Emergency Information Knowledge Graph Based on Large Language Models |
| 标题(中文) | 基于大语言模型的地震应急信息知识图谱构建与应用 |
| 作者 | Wentao Zhou, Meng Huang(通讯), Shuai Liu, Qiao You, Fanxin Meng |
| 机构 | 防灾科技学院 (Institute of Disaster Prevention) · 河北省高校智慧应急应用技术研发中心 · 四川省减灾中心 |
| 会议 | IEEE Access, vol. 13, pp. 127742–127757, 2025 |
| arXiv | DOI: 10.1109/ACCESS.2025.3586370 |
| 项目网站 | IEEE Xplore 论文页 |
背景与动机
震后信息有三个特征同时成立:来源异构、语义表达复杂、相互关联薄弱。社交媒体、新闻报道与震后现场调查会在短时间内产生大量实时文本,官方通报里"震中区发生强烈震动、数百栋建筑倒塌、应急队伍已派出"这类表述语义清晰,却普遍缺少精确地理信息与统一数据格式;与此同时,灾情评估、救援力量部署、物资调配、医疗资源分配与交通状况分属不同类型,跨类信息的关联推理能力不足,容易造成"信息掌握不完整、应急响应不及时"。
从技术脉络看,这个问题并不是简单再做一次命名实体识别就能解决。传统抽取器如BiLSTM-CRF与UIE在通用领域表现稳定,但面对地震专业术语与应急需求感知时,覆盖不完整、精度不足;把 HanLP 这类工具用于震后多源数据,也难以理解应急场景中的专业语义。知识推理侧,规则路径搜索与单跳向量距离方法依赖显式存在的关系,面对灾害链中跨句、隐含的因果与演化关系时推理覆盖率和泛化能力都有限。2023 年以来,大语言模型驱动的领域图谱构建在水利、电子、电子信息等场景陆续出现,但地震应急域仍然缺少把"领域知识注入"与"图推理可靠性"打通的完整方案。
这正是本文的切入点:不把大模型当作通用问答机器人,而是把它工程化为知识生产的一环——先用领域知识把抽取做准,再用置信度把推理做稳,最后用图数据库把答案做成可查询、可追溯的服务。
结合历史视角看,知识图谱技术经历了三个阶段:2012 年 Google 知识图谱确立了以实体—关系网络替代字符串检索的范式;2013 年 TransE 把关系建模为向量平移 $s + r \approx o$,为知识推理提供了分布式表示基石;2018—2022 年领域知识图谱在水务、医疗、洪水风险、核电等垂直场景大量涌现;2023—2025 年,大语言模型驱动的图谱构建成为主流。本文处在第三阶段的末端,把 LLM 抽取与图推理拼成地震应急闭环。
研究主线:从问题到结论
图 9:EQ-KG-LLM 的研究主线——从多源异构震后文本到可推理的应急知识图谱(Mermaid 流程图)
基准/方法设计
论文的核心设计是五层知识图谱构建框架:数据层汇聚多源异构原始数据,本体层定义统一的语义模式,实例层把具体数据映射为实体与关系实例,存储层用 Neo4j 承载,应用层提供问答与决策支持。这套分层把"数据"—"语义"—"实例"—"存储"—"应用"逐级解耦,直接后果是:换灾种只需替换本体层,换模型只需替换实例层的抽取器。
数据层用 Python 爬虫配合 APScheduler 任务调度自动抓取微博、微信群与公众号、新闻网站和论坛,并用 PyMuPDF、python-docx 解析震害报告类文档,统一转为结构化震害文本;采集过程做了匿名化去标识、限流与访问控制,只使用公开可访问内容。本体层则基于地震专家分类框架(高忠等、先富等的震害信息分类工作)建立实体—关系模板体系,覆盖10 大类、33 子类,包括震中位置、受灾区域、基础设施损毁、次生灾害、资源调配、人员伤亡、应急处置与救援行动;同时预置知识三元组作为对齐参考,例如 $\langle$震中位置, is, 泸定县$\rangle$、$\langle$交通, damaged, 山区道路$\rangle$、$\langle$次生灾害, includes, 滑坡$\rangle$。
实例层由 TPES-LLM 抽取实体与关系,输出标准 RDF 三元组,例如 $\langle$四川泸定 6.8 级地震, 震中位置, 泸定县附近$\rangle$、$\langle$四川泸定 6.8 级地震, 震源深度, 10 千米$\rangle$、$\langle$四川泸定 6.8 级地震, 触发, 滑坡$\rangle$。据论文报告,实体抽取准确率提升至 90.84%,实体—关系抽取准确率提升至 89.35%,相比 BiLSTM-CRF 与 UIE 有明显优势。
图 1:TPES-LLM 知识抽取总体框架——三层提示工程把任务模板、注意力权重与历史案例逐级注入大模型,抽取结果直接以 RDF 三元组形式落地
分类全景
本体层的实体—关系模板体系按"事件—区域—承灾体—次生灾害—应急响应"组织,十类实体并不是平行罗列,而是围绕一次地震事件的处置链条展开:
图 10:地震应急本体的分类全景——事件、区域、承灾体、次生灾害与应急响应五类实体及其关键联系(Mermaid 分类图)
方法细节
第一层:指令微调(LoRA)。为了在不破坏通用能力的前提下注入地震领域知识,论文采用 LoRA,只训练下投影矩阵 $A$ 与上投影矩阵 $B$,调整后的权重为 $W' = W + A \cdot B$,原始权重 $W$ 保持不变。训练样本来自地震专家分类框架与行业标准,文本用 BIO 标注方案逐词标注(例如"泸定县"标注为震中位置的起始符,"滑坡"标注为次生灾害的起始符),再转为指令式模板;论文给出的示例是,对"抽取次生灾害及其影响区域"这一指令,输入"地震引发多处滑坡,阻断通往丹巴县的主干道",期望输出为[次生灾害:滑坡]、[影响区域:丹巴县]。在多轮知识驱动样本训练后,$A \cdot B$ 的乘积学到"地震导致交通中断""降雨加剧次生灾害"这类语义偏置。
第二层:需求感知。这一层不再改任务模板,而是改注意力分布。论文统计实体对 $(e_i, e_j)$ 在真实震例文本中的共现频率 $C(e_i, e_j) = \sum_{n=1}^{N} \mathbb{1}(e_i \in X_n \land e_j \in X_n)$,其中 $X_n$ 是第 $n$ 篇文本的实体集合,指示函数在二者同时出现时取 1;随后把共现频率归一化为多头注意力中各实体的权重 $\alpha_h(e_i)$。论文以 2022 年泸定 6.8 级地震文本为例:从中抽出 6 对实体,总共现频次为 10,其中"道路损毁"与"交通中断"这一对的共现频次为 7,归一化权重为 0.7——高频共现实体对获得更大注意力权重,从而引导模型关注真正影响抽取结果的文本特征。
第三层:案例匹配。在实体识别与语义建模之后,论文引入36 个代表性历史震例,把抽取到的实体对与历史震害数据对齐,激活大模型预训练阶段已经具备的关联模式。论文用 2022 年四川芦山 6.1 级地震作为实证案例,从"震中位于 30.2°N、103.0°E,可能触发滑坡等次生灾害,S104 省道需在震后 48 小时内抢通"这段文本中,抽取出 $\langle$芦山 6.1 级地震, 震中位置, 30.2°N/103.0°E$\rangle$、$\langle$芦山 6.1 级地震, 可能触发次生灾害, 滑坡$\rangle$、$\langle$S104 省道, 抢通时间, 震后 48 小时内$\rangle$ 等三元组。
推理侧:Bi-GAT + PCCA。抽取完成后,仍有大量隐含信息没有显式记录,传统知识图谱推理机制难以捕捉跨实体、跨事件的隐式语义与多跳逻辑路径。论文设计双向图注意力网络,把注意力机制用于聚合节点及其关键邻居的特征,聚焦局部邻域而规避代价高昂的全局计算,同时为邻居节点分配可学习权重以反映其相对重要性;再用路径置信度约束算法对高权重邻居构成的路径逐跳打分,路径置信度定义为路径上各跳置信度的乘积 $P = \prod_{(e,r) \in Path} C(e,r)$,其中单跳置信度 $C(e,r) = \exp(-|h_e + h_r - h_{e'}|)$ 由 TransE 的向量关系计算,$h_e$、$h_r$ 与 $h_{e'}$ 分别是头实体、关系与尾实体的向量表示。推理时先做路径聚合,再用注意力为不同路径分配权重 $\alpha_i$,置信度越高的路径权重越大;最终以 $\hat{o} = \arg\sum_{P \in P} \alpha_P \exp(-|h_s + h_{\hat{r}} - h_o|)$ 选出得分最高的目标实体。举例来说,"地震触发滑坡、滑坡导致交通中断"与"地震触发滑坡、滑坡导致救援困难"是两条候选路径,模型按置信度判断哪条更可靠;多跳推理由此可以补全完整灾害链:地震(6.8 级)→ 触发 → 滑坡 → 阻断 → 主干道 → 导致 → 疏散困难 → 造成 → 人员被困 → 增加 → 伤亡。
图 2:三层提示工程系统的 LLM 知识抽取流程——指令微调、需求感知与案例匹配逐级串联,形成可累积的知识抽取能力
图 3:Bi-GAT + PCCA + 多跳关系推理结构——候选路径按置信度加权,隐含的灾害链被补全
图 4:地震应急知识图谱的五层构建框架——模块化解耦使方法可迁移到其他灾种
知识融合与动态更新。不同来源的命名习惯会导致同一实体出现多种表述,论文采用异构实体对齐策略把它们归一到标准实体,例如将"泸定 6.8 级地震""四川泸定地震""泸定震中"统一到四川泸定 6.8 级地震,将"滑坡灾害""岩崩""山体崩塌"统一到滑坡与落石。系统还会接入应急人员反馈来更新时空关联数据库,使推理过程持续迭代优化,最终形成动态的地震灾害知识图谱。
实验设计与结果
实验使用来自社交媒体、新闻报道与震后现场调查的多源非结构化文本,共8139 条长短文本,覆盖 2022 年 9 月 5 日四川泸定 6.8 级地震、2023 年 12 月 18 日甘肃积石山 6.2 级地震与 2025 年 1 月 7 日西藏定日 6.8 级地震。抽取实验基于地震情况、灾情与救援物资储备等信息构建了6021 条训练数据与 2119 条测试数据;消融实验另外收集了5292 篇震后新闻。评测指标为精确率 $P = \frac{TP}{TP+FP}$、召回率 $R = \frac{TP}{TP+FN}$ 与 $F1 = 2 \times \frac{P \times R}{P + R}$,同时统计平均识别时间;问答环节用 Hit@1 衡量 Top-1 结果是否包含正确答案。基线包括 BiLSTM-CRF、零样本通用抽取模型 UIE-base,以及不加任何提示的通用大模型。实验环境为 Python 3.8.17、CUDA 11.8 与一块 NVIDIA Tesla V100S,实体与关系匹配阈值设为 0.75。
实体识别对比(转写自论文表 2)
| 模型 | Precision | Recall | F1 | 耗时 (s) |
|---|---|---|---|---|
| BiLSTM-CRF | 0.7685 | 0.7232 | 0.7452 | 85.12 |
| UIE-base | 0.8456 | 0.8154 | 0.8302 | 66.73 |
| LLM | 0.8766 | 0.8565 | 0.8664 | 52.84 |
| TPES-LLM | 0.9284 | 0.9012 | 0.9152 | 36.51 |
关系抽取对比(转写自论文表 3)
| 模型 | Precision | Recall | F1 | 耗时 (s) |
|---|---|---|---|---|
| BiLSTM-CRF | 0.7154 | 0.7052 | 0.7103 | 141.65 |
| UIE-base | 0.7832 | 0.7624 | 0.7727 | 127.54 |
| LLM | 0.8201 | 0.8129 | 0.8165 | 82.98 |
| TPES-LLM | 0.8935 | 0.8716 | 0.8824 | 47.46 |
耗时方面,TPES-LLM 的实体识别平均 36.51 秒、关系抽取平均 47.46 秒;相比 BiLSTM-CRF,实体识别精度提升15.99%、时效提升57.11%,关系抽取精度提升17.81%、时效提升66.42%——精度与速度同时改善,而不是用算力换精度。
消融实验明细(转写自论文表 4 与表 5)
| 模型 | 实体 P | 实体 F1 | 关系 P | 关系 F1 |
|---|---|---|---|---|
| LLM 无任何提示 | 0.8069 | 0.7874 | 0.8069 | 0.7822 |
| TPES-LLM (WIF,去指令微调) | 0.8341 | 0.8069 | 0.8141 | 0.7869 |
| TPES-LLM (WD,去需求感知) | 0.8365 | 0.8202 | 0.8165 | 0.8002 |
| TPES-LLM (WCMA,去案例匹配) | 0.8523 | 0.8429 | 0.8342 | 0.8196 |
| TPES-LLM(完整) | 0.9094 | 0.8920 | 0.8894 | 0.8652 |
消融梯度是单调的:实体 F1 从 0.7874 一路升到 0.8920,平均识别时间从 41.47 秒降到 23.84 秒,说明三层提示中的每一层都不可替代——去指令微调的损失最大,去案例匹配对时效的影响最突出。
图谱问答检索效果(转写自论文表 6)
| 地震事件 | 检索问题 | Hit@1 | 平均响应时间 (s) |
|---|---|---|---|
| 2022 四川泸定 | 本次地震的伤亡情况如何? | 0.8962 | 2.3 |
| 2023 甘肃积石山 | 本次地震的伤亡情况如何? | 0.8728 | 2.5 |
| 2025 西藏定日 | 本次地震的伤亡情况如何? | 0.9023 | 2.1 |
图 5:实体识别模型对比——TPES-LLM 的精确率、召回率与 F1 全面领先,耗时也最短
图 6:关系抽取模型对比——需求感知与案例匹配把关系 F1 从通用 LLM 的 0.8165 提升到 0.8824
图谱构建结果。以 2022 年 9 月 5 日泸定 6.8 级地震为例,从多源震后文本中抽取136 个实体,合并后得到68 个唯一实体与 118 条关系,随后在 Neo4j 中完成可视化构建。实体抽取在中层表现也有差异:像"地震震情信息""地震灾情信息"这类特征清晰的类型精确率超过 90%,而"灾害现场动态信息"这类边界模糊的类型明显更弱;关系抽取中"支撑""影响"类关系优于"提供"类关系。
图 7:基于 TPES-LLM 的本体模型设计与知识抽取——本体层是整套系统的语义契约,决定实体对齐与路径推理的可行空间
图 8:地震应急知识图谱智能问答应用——从问题中抽取关键实体,在图谱中做关系匹配与推理,返回结构化答案
结果对比总结
图 11:从基线到落地——TPES-LLM 在三类基线上同时取得精度与效率优势并支撑图谱问答(Mermaid 对比图)
关键发现
- 三层提示带来单调增益:实体 F1 从无提示的 0.7874,经 WIF 0.8069、WD 0.8202、WCMA 0.8429,升到完整模型0.8920,同时耗时从 41.47 秒降到23.84 秒。
- 相对单级指令微调全面领先:实体识别的精确率提升8.90%、召回率提升11.99%、F1 提升10.55%,时效提升26.14%。
- 实体抽取普遍优于关系抽取:特征清晰的实体类型精确率超过90%,而关系抽取需要跨句理解上下文语义,"提供"类关系最弱。
- 问答满足应急时效要求:三个真实震例的 Hit@1 分别为0.8962、0.8728、0.9023,全部高于 87%,平均响应2.1–2.5 秒。
- 推理补全隐含灾害链:经 Bi-GAT 与 PCCA 打分后可串出"地震 → 滑坡 → 阻断主干道 → 疏散困难 → 人员被困 → 伤亡增加"的完整链条。
- 可复用性与可迁移性:五层框架解耦后,换灾种只需换本体层;泸定单一震例即得到 68 个唯一实体与 118 条关系,说明本体与对齐策略可复用到同类事件。
局限性
- 域内局限:研究只覆盖地震场景,灾害领域标注语料稀缺,尚未在洪涝、滑坡、台风等其他灾种上广泛应用。
- 规模化未验证:虽然实验结果可观,但在大规模、长期、多类型、连续实时数据流场景下的可扩展性与泛化性仍待验证。
- 隐含语义仍难:多灾种与具体位置的关系、灾害演化常跨句隐含表达,仍需更深的语义解析;文本噪声与冗余高度重复(例如"余震不断"与"未来 24 小时可能发生 2–3 级余震")。
- 证据面偏窄:完整图谱统计只给出泸定一个震例(136 个实体 → 68 个唯一实体、118 条关系),实体对齐阈值 0.75 的敏感性没有系统分析。
- 数字口径需核对:论文正文报告采集 8139 条文本,结论章节写作 8136 条;摘要写"2024 年积石山地震",正文与表 6 写"2023 年甘肃积石山";第三节的"实体抽取准确率 90.84%"与表 2 的 0.9284 也不一致。作者提出的未来方向是把方法扩展到洪涝、滑坡、台风等跨域灾害,并引入图像、语音、视频等多模态数据。
常见问题(FAQ)
这篇论文的核心方法 TPES-LLM 是什么?
TPES-LLM 是一个三层提示工程体系:指令微调用 LoRA 把地震专家分类体系与行业标准注入 Qwen2.5-7B,建立标准化的抽取任务模板;需求感知按实体共现频率归一化多头注意力权重,让模型关注高共现实体对;案例匹配引入 36 个历史震例,对齐抽取到的实体对以激活预训练中的关联模式。
它和直接用大模型做信息抽取有什么区别?
直接用通用大模型抽取的实体 F1 只有 0.8664,关系 F1 只有 0.8165;加入三层提示后分别提升到0.9152 与 0.8824,而且平均耗时从 41.47 秒降到 23.84 秒。差别不在模型规模,而在是否把领域知识、注意力先验与历史案例逐级注入。
Bi-GAT 与 PCCA 分别解决什么问题?
Bi-GAT 用局部邻域注意力聚合关键邻居节点特征,避免全局计算并提升泛化;PCCA 基于 TransE 为每一跳计算置信度 $C(e,r) = \exp(-|h_e + h_r - h_{e'}|)$,再以路径置信度 $P = \prod_{(e,r) \in Path} C(e,r)$ 对多跳路径整体打分,从而在灾害链推理中给出可靠性排序,而不是把所有路径等同看待。
知识图谱最终能做什么?
基于 Neo4j 构建的图谱支撑一个地震应急信息智能问答助手,可以回答伤亡情况、受灾最重区域、已派出救援队伍、应急物资需求、道路与桥梁阻断、可用医院与安置点、相似历史震例等问题。三个真实震例的 Top-1 检索准确率在0.8728–0.9023之间,响应时间2.1–2.5 秒。
论文的数据规模有多大?
多源文本共8139 条,来自社交媒体、新闻报道与震后现场调查;抽取实验使用6021 条训练数据与 2119 条测试数据,消融实验额外收集5292 篇震后新闻;知识注入与案例匹配使用36 个历史震例;本体覆盖10 大类、33 子类。
引用论文数字时需要注意什么?
建议回到原始表格核对。论文存在几处口径不一致:正文 8139 条与结论 8136 条;摘要"2024 年积石山"与正文/表 6 的"2023 年甘肃积石山";第三节"90.84%"与表 2 的 0.9284。表格数据本身自洽,引用时以表格为准更稳妥。
参考链接
- 论文(IEEE Access 2025): 10.1109/ACCESS.2025.3586370 / IEEE Xplore 页面
- LoRA: Low-Rank Adaptation of Large Language Models: arXiv:2106.09685
- LasUIE(UIE 系通用信息抽取): arXiv:2304.06248 / NeurIPS 2022
- A Survey on Knowledge Graphs: Representation, Acquisition, and Applications: IEEE TNNLS 2022
- Gemini and Physical World: LLMs Can Estimate the Intensity of Earthquake Shaking from Multimodal Social Media Posts: Geophys. J. Int. 2025 / arXiv:2405.18732
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)