大家读完觉得有帮助记得关注和点赞!!!
摘要
战略网络威胁情报侧重于高层面的洞察,例如识别被针对的行业、将攻击归因于特定的勒索软件组织,以及评估数据丢失的规模。如今,X(原Twitter)已成为获取此类情报的最快来源,通常会在正式的厂商报告发布前几天就发布实时的违规公告。将这种原始的讨论转化为可操作的情报,需要驾驭复杂的语言环境。传统的命名实体识别模型难以解析社交媒体上非正式且高度不规则的方言,这给自动化防御系统带来了盲点。为应对这一挑战,我们引入了 STINER,一个用于从社交媒体流中提取战略情报的分类体系和专家标注语料库。我们构建了一个高质量的、由专家标注的包含 2,100 条真实世界警报的数据集,并提出了一个细粒度的分类体系,包含八种实体类型,聚焦于诸如威胁行为体、行业和位置等战略支点。我们在 12 种评估配置中对 9 种模型进行了基准测试,涵盖了通用和领域自适应编码器、开放模式提取,以及零样本和微调设置下的生成式大语言模型。领域自适应编码器(如 DarkBERT)达到了 89.33% 的严格 F1 分数,优于通用基线和微调后的大语言模型,后者还伴随着明显更高的推理延迟。利用 STINER-DarkBERT,我们对 2025 年上半年的欧洲威胁态势进行了分析。我们的结果与关于主要目标的官方报告一致,同时突出了西班牙攻击事件的独特可见性特征,并说明了社交媒体驱动的提取如何在 SafePay 勒索软件活动被事后纳入厂商威胁态势报告之前,就能捕捉到其早期信号。
关键词: 网络威胁情报 命名实体识别 社交媒体挖掘
1 引言
网络威胁情报通常分为四个层次:技术、战术、操作和战略[1]。虽然安全行业在自动化技术层方面已达到较高成熟度,每天可摄入数百万个原子级入侵指标(如 IP 地址和文件哈希值)[2],但在战略层面仍然存在关键差距。如“痛苦金字塔”所示,原子级指标对攻击者而言易于更改,对防御者而言易于检测,而战略洞察则需要上下文推理,并且在很大程度上仍难以自动化[3]。
战略网络情报侧重于威胁态势的“谁”、“为什么”和“多少”,而非技术层面的“什么”和“如何”[4]。它通过回答诸如“我的行业是否正被针对?”或“哪个威胁行为体在我的地区活动?”等问题来支持高层决策。与短暂的技术指标不同,战略网络情报为长期规划、资源分配和组织风险管理提供信息。
传统上,获取此类情报需要人工分析长篇的厂商报告或访问昂贵的付费信息源[5, 6]。然而,现代威胁行为体的行动节奏已改变了情报传播的主要渠道。如今,战略风险的最早和最细粒度的信号,包括勒索软件受害者公告、初始访问代理拍卖和黑客活动分子的攻击目标声明,首先发布在 X 等社交媒体平台上,通常比它们出现在正式报告中要早几天[7, 8]。
将社交媒体用于网络威胁情报引入了一个固有的权衡。正式的厂商报告需要数周才能发布,正是因为分析师必须严格核实事实、过滤偏见并确认真实性。相比之下,社交媒体提供了极快的速度,但本质上是嘈杂且未经核实的。为了利用这种高速流而不被噪音淹没,自动化系统必须首先隔离并结构化所提出的主张(例如,某个特定的勒索软件集团声称入侵了一个目标行业)。虽然核实这些主张是下游任务——通常需要与暗网泄露信息交叉参考或分析转发和情感等社交元数据——但将非结构化文本进行结构化处理是关键瓶颈。
社交媒体并非仅仅充当警报机制,它已演变成一个整合的情报聚合器[9]。如图1所示,单一的流提供了对不同行为体和活动的可见性,消除了分析师手动监控碎片化来源的需要。这种转变使得主动过滤成为可能:防御者可以隔离针对特定地区或行业的威胁。为了大规模实现这一能力,需要强大的自动化提取。
命名实体识别天然适合此任务,然而现有的网络威胁情报资源从根本上与社交媒体领域不匹配。著名的开源数据集如 DNRTI [10] 和 CyNER [11] 几乎完全源自长篇的厂商报告和高级持续性威胁白皮书。在此类正式文本上训练的模型难以应对社交媒体网络威胁情报中不规则的、缩写的和以井号标签驱动的语法,其中归因通常是隐式的(例如,#LockBit),而目标很少明确说明。先前关于社交媒体网络威胁情报的工作已产生标注语料库,但这些语料库要么针对二分类相关性[12, 13, 14],要么针对侧重于受影响产品、版本和漏洞的技术实体提取[15]。据我们所知,没有公开的、专家标注的社交媒体语料库针对战略层面——受害者组织、行业和量化的泄露影响——而这正是组织风险决策所依据的层面。
为填补这一空白,我们引入了 STINER(战略威胁情报命名实体识别),这是一种用于从社交媒体中提取战略网络威胁情报的资源。STINER 包含三部分:一个包含八种战略实体类型的分类体系,一个包含 2,100 条网络威胁情报推文的专家标注语料库,以及一份报告编码器、开放模式模型和生成模型在其上性能表现的基准测试。STINER 不包含自身模型。它定义了要提取的内容,并提供了训练提取器所需的标注数据,而架构的选择是开放的。在整篇论文中,STINER 指代这一资源,而 STINER-DarkBERT 指代我们在其上训练的性能最佳的提取器,我们将其用于第 5 节的分析。
我们的贡献有三方面:
面向社交媒体的战略网络威胁情报命名实体识别数据集: 我们发布了一个包含 2,100 条专家标注的网络威胁情报推文的精选语料库,覆盖八种战略实体类型,以及数据集构建过程中使用的上游网络威胁情报相关和不相关分类分区。与先前标注相关性或技术指标的社交媒体网络威胁情报语料库不同,STINER 标注了受害者、行业和影响实体。数据集、标注指南和实验资源可在 https://github.com/ChammakhYasir/STINER 公开获取。
广泛的基准测试: 我们对领域自适应编码器和生成式解码器进行了严格的比较,证明像 DarkBERT 这样的专用模型在嘈杂的社交媒体文本上实现了卓越的提取准确率(严格 F1 为 89.33%),同时保持了毫秒级的推理延迟。
欧洲威胁态势分析: 我们利用 STINER 重建了 2025 年上半年的欧洲战略威胁态势,证实了关于顶级目标(德国、意大利、西班牙)的官方报告。至关重要的是,我们展示了结构化社交媒体主张如何提供可操作的前置时间,成功地在 SafePay 勒索软件活动被纳入正式厂商报告之前识别了其升级。
图 1: 来自 Twitter (X) 的代表性网络威胁情报警报。非结构化文本包含密集的战略指标,包括目标、行业和行为体。
2 相关工作
网络威胁情报的自动化已从简单的关键词过滤发展到语义提取管道,这主要由能够捕捉领域特定威胁语言的标注语料库的可用性所驱动。
早期的网络威胁情报命名实体识别工作依赖于长篇威胁报告。诸如 DNRTI [10] 和 Gao 等人[16] 的工作等数据集,在厂商白皮书上训练 BiLSTM-CRF 模型以提取恶意软件名称和技术指标。较新的资源,包括 CyNER [11] 和协调的 CyberNER 语料库[17],在诸如 STIX 2.1 [18] 等框架下标准化了这些工作。然而,这些数据集共享一个关键限制:它们几乎完全源自正式的、长篇的报告。当模型应用于社交媒体网络威胁情报时,这造成了显著的领域不匹配,在社交媒体中,语言是缩写的,归因是隐式的(例如,井号标签),并且诸如表情符号等视觉分隔符起着语义作用。在厂商散文上训练的模型难以泛化到这种非正式、高速的环境,特别是对于诸如受害者行业或泄露影响等战略实体。
第二类工作直接针对社交媒体。Behzadan 等人[12] 发布了一个用于网络威胁相关性分类的标注 Twitter 语料库,Le 等人[13] 将同一任务构建为针对 CVE 描述的新颖性检测,避免了负训练样本引入的采样偏差。Simran 等人[14] 通过用于推文级威胁分类的深度文本表示方法扩展了这一方向。与我们工作最接近的是,Dionísio 等人[15] 将 CNN 相关性分类器与推文上的双向命名实体识别模型配对,证明了从社交媒体网络威胁情报中进行令牌级提取是可行的。最近,Arikkat 等人[19] 使用基于 BERT 的相关性过滤器从精选的 Telegram 频道构建了一个大规模网络威胁情报数据集,将社交媒体网络威胁情报收集扩展到 Twitter 之外。这些努力确立了社交媒体作为可行网络威胁情报来源的地位,但它们的标注模式仍然面向技术层面:实体表示受影响的产品、版本和漏洞,支持补丁优先级排序而非战略风险评估。因此,STINER 是互补而非竞争的,它标注了谁受害、在哪个行业和地区,以及以何种量化成本受害。
自然语言处理领域的并行工作通过诸如 WNUT17 [20] 等基准和 BERTweet [21] 等模型解决了嘈杂的用户生成文本,证明针对特定媒体进行预训练显著提高了对不规则语法的鲁棒性。然而,这些模型缺乏网络安全语义。例如,一个在 WNUT 上训练的模型可能正确识别“LockBit”为一个实体,但将其错误分类为通用组织,或者无法区分提及的公司与被入侵的受害者。这暴露了一个持续的空白:现有资源要么处理社交媒体语法,要么处理网络安全语义,但不能同时处理两者。
在此背景下,大型语言模型的最新进展重新引发了人们对生成式架构是否可以在没有任务特定训练的情况下弥合这一差距的兴趣。它们在广泛的语言理解任务上的强劲表现,导致越来越多地探索将大型语言模型用于网络威胁情报提取,通常假设仅凭指令遵循可能就无需专门的命名实体识别系统。然而,实证证据越来越多地挑战这一假设。Mezzi 等人[22] 表明,GPT-4 和 Claude 等模型在应用于网络威胁情报时表现出不一致的提取行为和幻觉。Shafee 等人[23] 在开源情报中报告了类似发现,大型语言模型在分类上表现良好,但在令牌级提取上表现不佳。AthenaBench 评估[24] 进一步突显了在复杂威胁场景上的推理局限性。除了准确性,自回归解码的延迟使得大型语言模型在处理高容量社交媒体流的实时处理中不切实际。
除了社交媒体,地下论坛和市场构成了一个具有显著不同可见性属性的互补网络威胁情报来源。先前的工作已对从黑客论坛讨论中提取的安全事件进行了聚类和排序[25],表明可以从对抗性社区文本中恢复可操作的信号。另一条并行的工作路线是刻画行为体本身而非事件,使用基于图和表示学习的方法对网络犯罪论坛中的有影响力参与者进行排序[26, 27, 28]。这些来源以公共社交媒体的速度和广度为代价,换取了对抗性上下文的深度,我们将跨平台整合视为未来工作(第6节)。
综上所述,先前的工作揭示了网络威胁情报自动化中的一个结构性空白:以报告为中心的数据集在社交媒体语法上失败,社交媒体的自然语言处理缺乏领域语义,而大型语言模型既不精确也不具备操作效率。STINER 通过将社交媒体原生数据集与战略网络威胁情报分类体系相结合来弥补这一空白,实现了精确、低延迟的提取,性能优于通用大型语言模型和基于报告训练的基线。
3 STINER 数据集构建
本节描述 STINER 语料库的构建过程,包括战略实体分类体系、数据收集流程以及用于确保一致可靠标注的专家标注工作流。
3.1 分类体系定义
虽然诸如 MITRE ATT&CK 和 STIX 2.1 等既定框架是建模战术网络威胁情报的全球标准(例如,捕获特定的利用向量、恶意软件家族和原子指标),但它们与社交媒体披露的性质根本不对齐。公开的勒索声明和初始访问代理拍卖很少详述技术程序;相反,它们侧重于经济杠杆和业务影响。因此,我们并非将高层次的社交媒体讨论强行纳入战术框架,而是特意设计了 STINER 分类体系以捕获战略情报。它重构了安全事件的核心叙述:谁受到影响、事件发生在何处以及影响有多严重。
该模式的核心是 TARGET(受害者组织)和相应的 SECTOR(例如,医疗、能源),它们共同允许追踪个别事件以及随时间推移的更广泛的行业级趋势。为支持地理和归因分析,我们还提取受害者 LOCATION 和声称负责的威胁 ACTOR。
为表征事件影响,我们标注了泄露严重性的定量和定性指标。这些包括被外泄数据的 SIZE(例如,“500 GB”)、涉及的 DATA_TYPE(例如,“源代码”、“电子邮件”)以及与勒索要求或数据销售相关的 PRICE。这些实体共同为下游影响评估和经济分析提供了必要的背景。所有八种实体类型的完整定义见表1。
表 1:STINER 实体分类体系,按核心战略支点(目标、行为体、行业、位置)和影响相关上下文(大小、数据类型、价格、日期)进行组织。
实体标签 | 定义 | 示例 |
|---|---|---|
TARGET | 受事件影响的组织、公司或机构。 | 威奇塔州立大学, 塔科马工程师 |
ACTOR | 声称负责的勒索软件组织或威胁行为体。 | LockBit, PLAY, IntelBroker |
SECTOR | 受害者运营所在的行业或市场领域。 | 医疗, 能源, 金融 |
LOCATION | 与受害者相关的国家或地区。 | 美国, 意大利, 法国 |
SIZE | 报告的外泄数据量或记录数。 | 10GB, 1.4TB, 完整转储 |
DATA_TYPE | 受损信息或资产的类别。 | 个人身份信息, 源代码, SQL 转储 |
PRICE | 与该事件相关的赎金要求或出售价格。 | $1500, 10 BTC, 50万美元 |
DATE | 与披露或事件时间相关的明确日期。 | 2025-02-14, 2024年10月 |
图 2: 数据集构建过程中使用的标注界面快照。
3.2 数据收集与筛选
我们使用 Apify [29] 平台收集了约 66,500 条推文,并使用轻量级基于 BERT 的分类器筛选出与网络威胁情报相关的子集。从这个子集中,选取了 2,100 条推文供专家标注。筛选过程优先考虑来源多样性和时间覆盖,从独立安全研究人员中进行比例抽样,并降低高流量新闻聚合器的权重。推文从 2022 年到 2025 年均匀采样,以避免时间偏差并反映不断演变的报告实践。
3.3 标注方法
所有推文均由两名网络安全研究人员使用 Label Studio 界面 [30](图2)进行手动标注。为评估标注一致性,数据集的 10%(210 条推文)由两名标注者独立标注,在跨度级别使用精确匹配标准(要求实体边界和标签完全一致)计算,得到了 Cohen's [31] κ = 0.84 的标注者间一致性。剩余的差异通过资深评审员的裁决来解决,以建立一致的指南。
一个反复出现的分歧来源涉及官方名称中包含地理描述的组织(例如,“韩国环境部”)。为解决此问题,我们定义了一个身份规则:当地理名称是组织官方名称的一部分时,它被包含在 TARGET 跨度内;当地理名称在语法上是独立的(例如,“位于韩国”),则被标注为独立的 LOCATION 实体。此规则确保了整个语料库中对命名实体处理的一致性。
表 2:STINER 数据集中实体标注的分布。
实体类型 | 数量 | 频率 (%) |
|---|---|---|
LOCATION | 4,728 | 27.36 |
TARGET | 3,743 | 21.66 |
DATA_TYPE | 3,419 | 19.79 |
ACTOR | 2,430 | 14.06 |
SECTOR | 1,244 | 7.20 |
SIZE | 978 | 5.66 |
PRICE | 561 | 3.25 |
DATE | 178 | 1.03 |
总计 | 17,281 | 100.0 |
3.4 数据集统计与特征
最终的 STINER 语料库包含 2,100 条标注推文,总计 85,066 个令牌。每条推文包含多个战略实体,平均每个样本有 8.23 个实体。此密度显著高于通用社交媒体基准(如 WNUT-17 [20]),后者平均每条推文少于一个实体。
数据集词汇表包含 7,870 个唯一令牌,类型-令牌比率为 0.093。这反映了网络威胁报告中常见的专业化和重复性术语,其中技术术语在不同事件中频繁出现。因此,该数据集强调领域特定概念而非对话语言。
如表2所示,大多数标注对应于上下文实体,如 LOCATION、TARGET 和 ACTOR,它们构成了归因和态势感知的基础。影响相关实体,如 DATA_TYPE 和 SIZE,也有很好的代表性,使得能够对泄露严重性进行定量分析。相比之下,PRICE 仍然相对不常见,反映出赎金要求通常在私下协商,并不总是在公开报告中披露。
4 模型基准测试
为识别用于实时战略情报提取的最佳架构,我们进行了最先进自然语言处理模型的严格比较研究。本节详述我们的实验框架,对比专用判别式编码器与生成式方法在精度和延迟的严格操作约束下的效果。
4.1 实验设置
我们使用旨在反映现实世界部署条件的时间评估协议来评估 STINER。数据集按时间顺序分为训练集(70%)、验证集(15%)和测试集(15%)分区。具体来说,训练集包含从 2022 年到 2024 年中期的推文,而测试集仅包含 2024 年末到 2025 年的推文。这确保了模型在面对未来的、未见过的威胁活动时进行评估,而不是记忆同一时间段的事件。由于威胁行为体、活动名称和受害者组织迅速演变,2025 年的测试分区包含了训练数据中未出现的威胁组织和受害者组织。这种设计提供了更强的证据,表明框架是基于语言上下文和网络安全语义进行泛化,而非仅仅匹配已知行为体的静态字典——直接解决了跨多年数据集中评估污染的风险。
所有模型均直接在原始推文文本上操作,保留 URL、话题标签、表情符号和用户句柄,这些在社交媒体网络威胁情报中通常传达归因和活动级信息。
我们对四个模型家族进行了基准测试:
通用编码器: BERT-Base [32] 和 Twitter-RoBERTa [33]。
领域特定编码器: SecBERT [34], DarkBERT [35], 和 CySec-BERT [36]。
开放模式编码器: GLiNER-Large-v2.1 [37],在零样本设置中使用自然语言标签描述进行评估。
生成式大语言模型: Llama-3-8B [38], Gemma-2-9B [39], 和 Qwen-2.5-14B [40],在零样本配置(指令提示)和通过 QLoRA [41] 进行监督微调后进行评估。
只有这些模型的子集在 STINER 上进行了训练。五个判别式编码器(BERT-Base, Twitter-RoBERTa, SecBERT, CySecBERT, DarkBERT)在 STINER 训练集上进行了微调,三个生成模型在其 QLoRA 配置中也是如此。其余条目——GLiNER 和三个零样本配置下的指令微调大语言模型——从未见过 STINER 训练数据,仅使用标签描述或提示直接在测试集上进行评估。所有十二个条目都在相同的保留测试集上进行了评估,因此训练和未训练的配置可直接比较。
基于编码器的模型使用标准的线性令牌分类头进行训练。我们额外评估了条件随机场解码作为一项有针对性的消融研究(第4.3节)。生成模型采用约束 JSON 解码以强制固定的输出模式。
提取质量使用跨度级别的微平均 F1 进行衡量,采用严格匹配标准,要求预测实体跨度与真实实体跨度完全一致。有关批处理策略、硬件配置和延迟测量的详细信息,请参见附录 0.A。
4.2 性能分析
表3展示了九种模型在 12 种配置下对保留测试集的比较评估。我们的分析揭示了领域适应、模型规模和操作延迟之间的关键权衡。
社交媒体语法 vs. 领域词汇
DarkBERT (89.33%) 和 Twitter-RoBERTa (89.23%) 实现了几乎相同的性能,表明仅网络安全特定词汇并非社交媒体网络威胁情报中提取质量的主导因素。相反,对平台特定语法(如话题标签、用户句柄、缩写和表情符号)的鲁棒性同样重要。
这一效应通过 SecBERT (严格 F1: 71.69%) 较弱的性能得到突显。尽管 SecBERT 编码了丰富的网络安全术语(例如,CVE 和恶意软件家族),但其在正式的高级持续性威胁报告上的预训练限制了其泛化到推文缩写和不规则语法的能力。Twitter-RoBERTa 尽管缺乏明确的网络安全领域预训练,但受益于其原生接触社交媒体语言,因此表现具有竞争力。DarkBERT 结合了非正式语法暴露和网络安全领域语义,实现了最强的整体性能,并证明了使媒介和领域对齐的重要性。
表 3:综合基准测试结果。我们比较了专用编码器与生成式大语言模型在零样本 (*) 和微调设置下的性能。严格 F1 要求精确的跨度边界。延迟表示每个样本(一条推文)的推理时间。
模型架构 | 严格 F1 | 精确率 | 召回率 | 延迟 (毫秒) |
|---|---|---|---|---|
判别式编码器 (微调) | ||||
DarkBERT [35] | 89.33 | 87.76 | 90.95 | 0.71 |
Twitter-RoBERTa [33] | 89.23 | 87.66 | 90.85 | 0.71 |
CySecBERT [36] | 87.02 | 84.20 | 90.04 | 0.71 |
BERT-Base (基线) [32] | 85.01 | 81.85 | 88.42 | 0.71 |
SecBERT [34] | 71.69 | 67.95 | 75.86 | 0.37 |
开放模式模型 | ||||
GLiNER-Large-v2.1* [37] | 71.31 | 74.34 | 68.53 | 35.55 |
生成式大语言模型 (零样本 vs. 微调) | ||||
Gemma-2-9B-IT* [39] | 76.35 | 86.27 | 68.48 | 331.54 |
Llama-3-8B (微调) [38] | 74.55 | 78.65 | 70.86 | 1965.94 |
Gemma-2-9B (微调) [39] | 72.59 | 82.09 | 65.07 | 3937.96 |
Qwen-2.5-14B (微调) [40] | 66.70 | 82.33 | 56.06 | 6473.18 |
Qwen-2.5-14B-Instruct* [40] | 59.74 | 86.13 | 45.73 | 171.77 |
Llama-3-8B-Instruct* [38] | 27.78 | 89.56 | 16.43 | 110.72 |
生成式人工智能的召回危机
虽然零样本大语言模型实现了高精确率(86-89%),但它们表现出严重的召回率下降(16-45%)。这种模式表明了一个明显的召回率限制:生成模型可靠地提取明确、格式良好的实体(例如,“LockBit”),但经常遗漏社交媒体网络威胁情报中常见的缩写或不规则表达(例如,“#lockbit3”、“500GB dump”)。
使用 QLoRA 进行微调显著缓解了此问题。最引人注目的是,Llama-3 从 27.78% 的严格 F1 提高到 74.55%——一个 47 个百分点的增益,直接量化了针对社交媒体网络威胁情报提取的领域特定监督数据的贡献。这证明了仅靠指令提示是不够的;模型必须直接在现实世界社交媒体披露中的语言惯例上进行训练,才能实现操作上可用的召回率。关键在于,即使在微调后,最佳生成模型(Llama-3 为 74.55%)仍比 DarkBERT (89.33%) 低 15 个百分点,同时承受超过 2,700 倍的延迟惩罚,使得基于编码器的架构成为操作部署的明确选择。
操作延迟考量
当战略网络威胁情报提取被嵌入连续监控或早期预警管道时,延迟变得相关。在此类设置中,基于编码器的模型在批处理推理下可在 1 毫秒内处理样本,实现对高容量社交媒体流的近实时分析。相比之下,微调后的大语言模型每个样本的延迟达数秒,限制了其用于离线或低吞吐量分析。
因此,STINER 数据集直接兼容依赖于实时命名实体识别进行安全事件检测和优先级排序的系统,例如流式开源情报管道和早期预警框架(例如,Tweezers [7])。在这些架构中,低延迟提取是先决条件,即使下游情报任务是战略性的而非反应性的。
GLiNER:冷启动折衷方案
GLiNER 占据了一个独特的操作生态位。尽管其零样本性能(71.3% F1)落后于微调后的编码器,但它不需要标注数据。这使其非常适合零日场景,例如新兴威胁行为体或新型活动类型,其中没有可用的标注示例。GLiNER 提供了比大语言模型快一个数量级的速度优势,同时为初始分流提供了足够的准确性,在可以训练专用编码器之前充当临时解决方案。
4.3 消融研究:结构化解码的影响
表 4:CRF 解码对基于编码器的命名实体识别模型在 STINER 测试集上的有效性(严格跨度级微平均 F1)和效率(每样本延迟)方面的影响。
模型 | 线性 F1 | +CRF F1 | Δ F1 | 延迟 (毫秒) | 减速比 |
|---|---|---|---|---|---|
BERT-Base | 0.850 | 0.831 | −0.019 | 0.71 → 4.84 | 6.8× |
Twitter-RoBERTa | 0.892 | 0.838 | −0.054 | 0.71 → 5.05 | 7.1× |
SecBERT | 0.717 | 0.769 | +0.052 | 0.37 → 3.32 | 9.0× |
CySecBERT | 0.870 | 0.849 | −0.021 | 0.71 → 4.85 | 6.8× |
DarkBERT | 0.893 | 0.841 | −0.052 | 0.71 → 5.06 | 7.1× |
诸如条件随机场之类的结构化解码层在网络威胁情报命名实体识别管道中被广泛采用,特别是在以报告为中心的环境中,已有研究表明它们通过强制执行有效的 BIO 转移约束来提高标签一致性(例如,[42], [43], [44])。受此先例启发,我们评估了 CRF 解码是否为社交媒体原生网络威胁情报提取提供了类似的好处。
我们比较了配备标准线性令牌分类头(独立预测标签)的基于编码器的模型与另一种强制执行结构化标签转移(例如,防止 I-ACTOR 跟在 B-MALWARE 之后)的 CRF 解码层。结果报告在表4中。
研究结果揭示了一个明确的准确性-效率权衡。虽然 CRF 解码提高了 SecBERT 的性能(+5.2 F1),可能补偿了其在非正式文本中较弱的上下文表示,但它持续降低了强编码器的性能。特别是,DarkBERT 和 Twitter-RoBERTa 在受到 CRF 解码约束时,F1 下降了超过 5 个百分点。
这种行为反映了 CRF 假设与社交媒体网络威胁情报结构之间的不匹配。推文经常包含碎片化实体、非常规边界和非规范语法,这些违反了严格的 BIO 转移模式。现代 Transformer 编码器通过自注意力隐式地模拟这些不规则性,而 CRF 解码则强制执行严格的马尔可夫约束,这可能会过度纠正语义上有效但句法上嘈杂的预测。
除了准确性,CRF 解码还引入了显著的计算开销。非并行化的维特比算法 [45] 将推理延迟增加了约 7 倍,将性能从亚毫秒级批处理推理转移到每样本几毫秒。因此,我们在最终的 STINER 管道中采用线性解码头,以平衡鲁棒的提取准确性和操作效率。
4.4 细粒度实体分析
图 3: 在 STINER 测试集上,最佳性能模型(带有线性解码头的 DarkBERT)的每个实体严格跨度级 F1 分数。
为分析优势和失败模式在实体层面的分布,我们报告了最佳配置(带有线性解码头的 DarkBERT)的每类性能。图3显示了八种战略实体类型的严格 F1 分数。
该模型在核心归因实体上实现了非常强的性能:LOCATION (95.0%)、ACTOR (91.9%) 和 TARGET (91.3%)。这些实体通常使用社交媒体网络威胁情报中独特的表面线索来表达,包括国家的旗帜表情符号、标准化的勒索软件组织名称和明确的组织提及。此类线索提供了清晰的信号,被基于 Transformer 的注意力机制有效捕获。
相比之下,SECTOR 表现最低 (76.2%)。对预测错误的检查表明,这主要是由于上下文歧义而非提取失败。在许多推文中,同一个词可能作为组织名称(TARGET)的一部分出现,或作为受害者业务领域(SECTOR)的描述出现,具体取决于上下文。解决这种歧义通常需要关于组织本身的知识,而这并不总是能从局部句子中获得。
对于下游风险评估至关重要,影响相关实体被高度可靠地提取。DATA_TYPE 达到了 89.1% 的严格 F1,SIZE 达到了 88.0%,表明模型一致地捕获了外泄数据的性质和规模。这使得能够基于数据敏感性和数量自动估计事件严重性,这是战略网络威胁情报分析的核心要求。
5 欧洲威胁态势分析(2025 年上半年)
鉴于该地区的地缘政治重要性和 NIS2 指令 [46] 的实施,我们将威胁态势分析重点放在欧洲地区。通过过滤 STINER-DarkBERT 提取的位于欧盟 27 国和英国境内的实体,我们重建了欧洲关键基础设施面临的战略风险态势。至关重要的是,为评估我们实时社交媒体提取的有效性,我们将我们的发现与权威的 ENISA 2025 年威胁态势报告 [47] 进行了基准比较。此比较证明,STINER 不仅证实了官方的回顾性数据,而且往往作为新兴活动的领先指标。
5.1 地理目标模式
图 4: 2025 年上半年公开声称的对欧洲国家的攻击,比较了 Q1 和 Q2 的趋势。
图4展示了我们数据集中受害者组织在欧洲的分布。西班牙成为我们数据集中的主要目标,紧随其后的是意大利和德国。
虽然这一发现在受影响最严重的国家方面与官方报告一致,但排名有所不同。ENISA 2025 年威胁态势报告基于已确认事件将德国列为受影响最严重的国家,而西班牙在源自社交媒体披露的 STINER 数据集中是出现频率最高的目标国家。这种差异反映了底层数据源的性质:ENISA 捕获的是已验证的事件,而 STINER-DarkBERT 衡量的是通过声明和勒索相关帖子所体现的攻击的公众可见性。因此,西班牙的突出地位表明其披露活动更为活跃,而非绝对事件数量更高。
为验证此假设,我们对特定于西班牙的威胁态势进行了细粒度提取。STINER-DarkBERT 成功识别出 Akira 和 Qilin 是 2025 年上半年针对该地区的两个主要对手。这一发现得到了 SOCRadar 西班牙 2025 年威胁态势报告的独立证实,该报告将这些组织列为最高的勒索软件威胁 [48]。这种一致性证实了 STINER-DarkBERT 不仅捕捉了广泛的趋势,而且无需人工干预即可准确重建区域网络冲突的具体归因特征。
5.2 时间分析:SafePay 案例研究
图 5: SafePay 勒索软件组织的每周提及速度。STINER-DarkBERT 检测到 2025 年 5 月中旬出现明显的活动高峰,大约比 ENISA 2025 年第二季度报告期间 SafePay 被确认为上升威胁早 6-7 周。
社交媒体驱动网络威胁情报的核心动机之一是时间分辨率。权威的威胁态势报告,如 ENISA 2025 年威胁态势报告 [47],必然以季度或半年为汇总周期运作,反映的是已确认和策划的事件。相比之下,STINER-DarkBERT 能够在公开讨论中实现事件动态的周级别可见性。
我们选择 SafePay 作为案例研究,因为它被 ENISA 明确确定为一种在 2025 年第二季度崛起的新兴勒索软件变种,在对欧盟公共行政部门的勒索软件攻击中,它成为部署第二多的变种(占该行业勒索软件声明的 33.3%)[47]。
图5显示,STINER-DarkBERT 在 2025 年 5 月 12 日至 18 日这一周检测到 SafePay 相关活动出现了一个急剧的拐点,表现为社交媒体上公开声明和受害者披露的突然增加。此峰值对应于该活动的早期升级阶段,当时操作者积极公开泄露事件以放大勒索压力和可见性。至关重要的是,此检测比 ENISA 在 2025 年第二季度将 SafePay 确认为上升威胁早了大约 6-7 周——这一差距直接量化了社交媒体驱动的网络威胁情报相对于机构报告周期所拥有的早期预警优势。这一轨迹得到了 ENISA 季度勒索软件声明数据的独立证实,该数据记录了 SafePay 在同一时期作为欧盟最活跃变种之一的激增 [47]。
这一时间差距突显了社交媒体驱动的情报与机构威胁报告之间的结构性互补关系。通过检测披露速度的拐点,STINER-DarkBERT 能够实现更早的防御行动,例如将行为体置于加强监控之下、发布特定行业警告,或优先对相关基础设施进行威胁狩猎。在此角色中,STINER-DarkBERT 充当了一个领先指标,预测了后来被权威威胁态势评估所证实的趋势。
5.3 量化情报差距
除了归因和时间,战略网络威胁情报中一个持续的挑战是量化影响。包括 ENISA 在内的官方机构明确承认,由于对泄露严重性的报告不足和披露不一致,评估经济及运营损害存在困难 [47]。
通过聚合 STINER 提取的 SIZE 实体,我们重建了 2025 年上半年泄露数据量的分布图。虽然事件计数通常因频繁的服务中断而突显公共管理部门,但我们的体积分析(表5)揭示了关于数据丢失的不同现实。
制造业成为数据外泄的主要受害者,泄露数据超过 146 TB,证实了工业间谍活动和勒索对这一垂直行业的沉重打击。值得注意的是,政府行业也遭受了大规模数据泄露(104 TB),表明除了网站中断,国家实体还面临严重的数据机密性破坏。这种对比突显了一个关键的情报差距:仅通过“事件数量”来衡量风险掩盖了真实的战略成本。STINER 提供了必要的量化维度,以便根据潜在数据丢失的严重程度来优先安排防御。
表 5:行业脆弱性分析:泄露数据总量(2025 年上半年)。
行业 | 泄露量 (GB) |
|---|---|
制造业 | 146,018 |
政府 | 104,445 |
军事 | 82,510 |
建筑与规划 | 71,680 |
医疗 | 67,365 |
5.4 战略威胁剖析:Medusa 团伙(2025 年第一季度)
图 6: Medusa 的赎金要求分布(2025 年第一季度)。
为说明 STINER 的细粒度,我们展示了 2025 年第一季度 Medusa 勒索软件团伙的聚焦画像。与隐藏谈判的团伙不同,Medusa 采用“公开拍卖”模式,公开公布赎金要求以加强勒索压力。
金融商业模式。 Medusa 的赎金要求中位数为 32 万美元,反映了其有意专注于具有足够流动性但运营韧性有限的中端市场受害者。中位数与 400 万美元最大值之间的巨大差距表明了一种分层定价策略,范围从截止日期延长到完整数据删除保证。
行业受害者学。 将赎金要求与 SECTOR 实体交叉引用显示,其集中于对中断敏感的行业,以医疗和建筑为首,其次是公共部门和教育组织。这种目标选择与 Medusa 的定价逻辑一致,即赎金要求被校准为具有财务胁迫性,但在长时间停机下又是现实可支付的。
6 结论与未来工作
在本工作中,我们提出了 STINER,一个用于从高速社交媒体流中提取战略网络威胁情报的开源资源。与先前标注相关性或技术指标的社交媒体网络威胁情报语料库不同,STINER 针对的是与自动化风险评估和决策支持直接相关的战略支点——目标、行业、行为体和影响。
通过全面的基准测试,我们表明领域和媒介自适应的编码器模型,特别是 DarkBERT (89.33% 严格 F1),优于通用编码器和大型生成模型,实现了约 15 个点的严格 F1 优势,同时运行在数量级更低的延迟下。通过涵盖 2025 年上半年的欧洲案例研究,我们进一步展示了 STINER 的实际价值,通过重建区域威胁动态,并在 SafePay 勒索软件活动被纳入官方威胁态势报告之前很久就识别了其升级。
6.1 局限性与伦理考量
我们的研究承认两个主要局限性。首先,当前数据集仅限于英文内容,可能低估了仅在俄语或中文网络犯罪社区中讨论的威胁。其次,依赖单一平台(X/Twitter)引入了对“高调”勒索活动的可见性偏差,同时可能遗漏在封闭论坛上讨论的更隐蔽的操作。
在伦理方面,我们仅使用 Apify 从公开可访问的帖子中收集数据,将收集范围限制在公开端点,并排除了任何私人内容。为在尊重平台再分发限制的同时支持可重复性,我们发布了推文 ID、跨度标注和代码;我们不重新分发推文文本。
6.2 战略效用
除了本文提出的分析,STINER 数据集还支持广泛的高影响力战略情报应用。结构化的实体支持复杂的归因和风险分析任务,例如识别哪些行业部门被特定的勒索软件组织系统性针对,或估计每个行业的平均赎金要求。此外,该数据集构成了一个高质量的指令微调资源,用于将大型语言模型扎根于现实世界的网络威胁情报中,从而在自动化分析和报告生成工作流程中大幅减少领域特定的幻觉。
6.3 未来方向
未来的工作将沿两个互补轴扩展 STINER 框架。首先,我们旨在通过提取实体之间的关系(例如,ACTOR → TARGET)构建时间知识图谱 [49],从而实现活动轨迹的预测性分析。其次,我们计划整合跨平台来源,如暗网泄露网站和 Telegram 频道,以量化“泄露滞后”——即私下勒索要求与其公开披露之间的时间差。通过弥合非结构化社交媒体讨论与结构化情报之间的差距,STINER 为下一代主动式、自动化的网络防御奠定了基础。