LightGBM结果解读:直方图算法与叶生长策略
2026/8/20 13:22:20 网站建设 项目流程

LightGBM分类模型结果解读

一、方法概述

LightGBM(Light Gradient Boosting Machine)是一种基于梯度提升决策树的高效机器学习算法,由微软研究院提出。该算法通过直方图算法、带深度限制的叶子生长策略等优化策略,显著提升了训练速度和内存效率,特别适用于大规模数据和高维特征的学习任务。本研究利用SPSSAU软件对欺诈检测数据进行LightGBM分类建模分析,旨在通过用户行为特征变量预测欺诈行为的发生,为风险识别提供量化依据。

在SPSSAU【机器学习】模块选择【LightGBM】,将变量拖拽至右侧对应分析框,操作如下图:

二、数据概览

本研究共纳入1000个样本,以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量,以欺诈标签(0=非欺诈,1=欺诈)作为因变量进行分类建模。因变量分布如下表所示:

由表1可知,1000个样本中非欺诈样本(标签=0)为600例,占比60.00%;欺诈样本(标签=1)为400例,占比40.00%。数据无缺失值,全部纳入分析。样本中非欺诈与欺诈的比例约为3:2,存在一定的类别不平衡现象,但尚未达到极端失衡的程度。

由表2可知,按照8:2的比例将数据划分为训练集和测试集。训练集包含800个样本(占80.00%),用于模型训练;测试集包含200个样本(占20.00%),用于评估模型的泛化能力。无预测集和缺失数据。

三、特征权重分析

由表3可知,特征权重反映了各自变量对LightGBM模型预测贡献的重要程度。交易金额的权重最高,为0.511(即51.10%),远超其他特征,说明交易金额是区分欺诈与非欺诈行为的最关键因素。支付失败次数的权重为0.145(14.54%),位居第二;换IP次数的权重为0.137(13.74%),位居第三。上述三项特征的权重合计达到79.39%,构成了模型判别的主要依据。换设备次数(0.104,10.36%)和换IP国次数(0.103,10.25%)的贡献相对较小,但仍具有一定的判别价值。

图1 LightGBM特征权重分布图

由图1可以直观看出,交易金额在特征权重中占据绝对主导地位,其柱形长度远超其他四个特征。支付失败次数与换IP次数的权重较为接近,形成第二梯队。换设备次数和换IP国次数的权重相对均衡,构成第三梯队。该分布特征提示,在欺诈检测场景中,交易金额是最具区分力的风险指标。

四、训练集模型评估

由表4可知,LightGBM模型在训练集上表现出极高的拟合效果。整体准确率达到99.80%,综合f1-score为0.997,接近完美分类。具体到各类别:非欺诈类(0.0)的精确率为0.996,召回率为1.000,f1-score为0.998,表明模型对非欺诈样本的识别几乎无遗漏;欺诈类(1.0)的精确率为1.000,召回率为0.994,f1-score为0.997,说明模型对欺诈样本的识别同样高度准确。训练集上的优异表现说明模型充分学习了数据中的分类模式。

五、测试集模型评估

由表5可知,LightGBM模型在测试集上的整体准确率为88.50%,综合精确率为89.53%,综合召回率为88.50%,综合f1-score为0.881。相较于训练集(准确率99.80%),测试集性能有所下降,存在一定的过拟合现象,但整体分类效果仍然可以接受。

从各类别看:非欺诈类(0.0)的精确率为0.855,召回率为0.984,f1-score为0.915,说明模型对非欺诈样本的识别能力较强,召回率高达98.4%,极少将非欺诈样本误判为欺诈。欺诈类(1.0)的精确率为0.964,召回率为0.716,f1-score为0.822。欺诈类的精确率较高(96.4%),表明模型预测为欺诈的样本中绝大多数确为欺诈;但召回率偏低(71.6%),意味着约28.4%的欺诈样本被漏判,这是实际应用中需要重点关注的问题。

六、模型参数汇总

由表6可知,本模型采用gbdt提升器类型,构建100棵学习器,学习率为0.1。树最大深度设置为-1(不限制),树最大叶子数为31,子节点最小样本数为20。样本采样率和单树采样率均为1.0,即未进行额外的随机采样。未进行数据预处理和交叉验证。模型最终在测试集上取得88.50%的准确率和0.881的f1-score。

七、结论

本研究基于SPSSAU平台,利用LightGBM算法对1000个欺诈检测样本进行分类建模分析。结果表明,交易金额是最重要的欺诈判别特征(权重51.10%),其次为支付失败次数(14.54%)和换IP次数(13.74%)。模型在测试集上的准确率为88.50%,综合f1-score为0.881,整体分类效果良好。但需要注意的是,模型对欺诈样本的召回率仅为71.6%,存在一定的漏判风险,在实际应用中可考虑通过调整分类阈值或采用过采样策略加以改善。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询