ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

极端随机树结果解读:高随机化的集成分类模型

极端随机树结果解读:高随机化的集成分类模型 极端随机树分类模型结果解读一、方法概述极端随机树Extra TreesExtremely Randomized Trees是一种集成学习方法通过构建多棵极度随机化的决策树来提高模型的泛化能力和稳定性。与随机森林不同极端随机树在节点分裂时不仅随机选择特征子集还随机选择分裂点这种额外的随机性有助于进一步降低方差、提升模型的鲁棒性。本研究利用SPSSAU软件对欺诈检测数据进行极端随机树分类建模分析以评估该方法在欺诈识别任务中的有效性。在SPSSAU【机器学习】模块选择【极端随机树】将变量拖拽至右侧对应分析框操作如下图二、数据概览本研究共纳入1000个样本以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量以欺诈标签0非欺诈1欺诈作为因变量进行分类建模。因变量分布如下表所示由表1可知1000个样本中非欺诈样本标签0为600例占比60.00%欺诈样本标签1为400例占比40.00%。数据无缺失值全部纳入分析。由表2可知按照8:2的比例将数据划分为训练集800个样本占80.00%和测试集200个样本占20.00%用于模型训练与泛化能力评估。三、特征权重分析由表3可知极端随机树模型的特征权重分布呈现出以行为特征为主导的格局。换设备次数的权重最高为0.26026.00%对模型构建起关键作用。换IP国次数位居第二权重为0.24224.22%。支付失败次数的权重为0.21521.48%。以上三项特征的权重合计达到71.71%构成模型判别的主要依据。换IP次数0.14514.45%和交易金额0.13813.84%的贡献相对较小。值得注意的是与LightGBM不同交易金额在此模型中的权重最低而设备更换和IP变更等行为特征的重要性更为突出。图1 极端随机树特征权重分布图由图1可知极端随机树的特征权重分布呈现明显的三级梯度换设备次数26.00%、换IP国次数24.22%和支付失败次数21.48%构成第一梯队三者权重合计71.71%换IP次数14.45%和交易金额13.84%构成第二梯队。该分布表明在极端随机树模型中用户的行为模式变化设备更换、IP变更比交易金额本身更具欺诈判别能力。四、训练集模型评估由表4可知极端随机树模型在训练集上达到了完美分类效果准确率、精确率、召回率和f1-score均为1.000。模型采用袋外数据测试OOB ScoreYes通过有放回采样产生的袋外数据对模型进行无偏估计有助于评估模型的泛化能力。训练集上的完美表现说明100棵决策树充分学习了数据中的分类规则。五、测试集模型评估由表5可知极端随机树模型在测试集上的整体准确率为88.00%综合精确率为89.14%综合召回率为88.00%综合f1-score为0.875。相较于训练集的完美表现测试集性能有所下降存在一定过拟合现象。从各类别看非欺诈类0.0的精确率为0.849召回率为0.984f1-score为0.912召回率高达98.4%表明模型对非欺诈样本的覆盖能力极强。欺诈类1.0的精确率为0.963召回率为0.703f1-score为0.813。欺诈类精确率较高96.3%但召回率仅为70.3%约29.7%的欺诈样本未能被模型识别这在六类模型中属于较低水平需要引起重视。六、模型参数汇总由表6可知极端随机树模型构建100棵决策树采用gini系数作为节点分裂标准树最大深度不做限制。节点分裂最小样本数为2叶节点最小样本数为1。采用有放回采样并进行袋外数据测试。模型在测试集上取得88.00%的准确率和0.875的f1-score。七、结论本研究基于SPSSAU平台利用极端随机树算法对1000个欺诈检测样本进行分类建模分析。结果表明换设备次数26.00%、换IP国次数24.22%和支付失败次数21.48%是最重要的三个判别特征三者权重合计71.71%。模型在测试集上的准确率为88.00%综合f1-score为0.875整体分类效果可接受。但欺诈样本的召回率仅为70.3%在六类模型中偏低建议在实际应用中结合其他模型或策略进行综合判断。
返回列表