ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SMOTE-variants性能评估:基于104个数据集的权威测评结果解读

SMOTE-variants性能评估:基于104个数据集的权威测评结果解读 SMOTE-variants性能评估基于104个数据集的权威测评结果解读【免费下载链接】smote_variantsA collection of 85 minority oversampling techniques (SMOTE) for imbalanced learning with multi-class oversampling and model selection features项目地址: https://gitcode.com/gh_mirrors/smo/smote_variantsSMOTE-variants是一个集成了85种 minority oversampling 技术的Python库专为不平衡学习设计支持多类别过采样和模型选择功能。本文基于104个数据集的测评结果深入分析不同SMOTE变体的性能表现为机器学习工程师和研究者提供实用的技术选型指南。测评数据集与方法概述本次测评使用了104个不平衡数据集涵盖不同行业场景和数据特征包括高/低不平衡比例、高/低特征维度等多种场景。所有实验结果均可通过项目中的examples/005_speed_test.ipynb脚本复现该脚本使用标准化的数据集划分方法确保测评结果的可比性和公正性。测评过程中系统会根据数据集特性自动分类高不平衡比例不平衡比率(IR) 阈值低不平衡比例不平衡比率(IR) ≤ 阈值高 minority样本量minority样本数 阈值低 minority样本量minority样本数 ≤ 阈值高特征维度特征数量 阈值低特征维度特征数量 ≤ 阈值核心评估指标解析测评采用多维度指标全面评估各SMOTE变体的性能主要包括AUC-ROC衡量模型区分正负样本的能力对不平衡数据尤为重要GACC (Geometric Mean Accuracy)平衡各类别准确率的几何平均值F1分数精确率和召回率的调和平均综合评估分类效果Ptop20前20%预测结果的精确率适用于排序任务这些指标在smote_variants/utils/legacy/study.py中通过以下代码实现results_agg results.groupby(bysampler).agg({ auc: np.mean, gacc: np.mean, f1: np.mean, p_top20: np.mean })主流SMOTE变体可视化对比不同SMOTE变体在数据分布调整上呈现出显著差异以下是三种典型算法的可视化效果ADASYN算法通过动态调整采样密度在难分样本区域生成更多合成样本有效改善了传统SMOTE对边缘样本的处理能力标准SMOTE算法在 minority 样本之间均匀插值生成合成样本是大多数变体的基础框架Gaussian SMOTE通过高斯分布生成合成样本增加了数据的多样性但可能引入噪声性能排名与关键发现通过对104个数据集的综合评估我们得出以下关键发现1. 总体性能排名在综合指标排名中表现优异的SMOTE变体包括ADASYN在高不平衡比例数据集上表现突出Gaussian SMOTE在特征维度较高的数据集上有优势Borderline-SMOTE对边界样本的处理能力较强2. 不同场景下的最佳选择高不平衡比例数据优先选择ADASYN、MWMOTE等关注难分样本的算法高特征维度数据推荐使用Gaussian SMOTE、KernelADASYN等基于概率分布的方法小样本数据Safe-Level SMOTE、MSMOTE等考虑样本安全级别的算法更稳健3. 计算效率对比在处理大规模数据集时以下算法表现出较高的计算效率Random SMOTE最简单快速但性能一般SMOTE平衡了效率和性能适合大多数场景NRAS在保持性能的同时具有较快的运行速度如何使用测评结果指导实践项目提供了完整的测评框架您可以通过以下步骤在自己的数据集上复现测评克隆仓库git clone https://gitcode.com/gh_mirrors/smo/smote_variants运行评估脚本# 示例代码来自examples/005_speed_test.ipynb sv_techniques sv.get_all_oversamplers() evaluator sv.Evaluator( oversamplerssv_techniques, classifierssv.get_all_classifiers(), datasetssv.get_104_datasets(), n_folds5, scoringaccuracy ) results evaluator.evaluate()生成自定义排名# 代码来自utils/legacy/study.py results_all ranking(results, databasesall) results_high_ir ranking(results, databaseshigh_ir)总结与未来展望SMOTE-variants通过85种过采样技术的集成和104个数据集的全面测评为不平衡学习提供了强大的工具支持。根据实际应用场景选择合适的SMOTE变体结合docs/model_selection.rst中的模型选择指南可以显著提升分类模型的性能。未来项目将继续扩展测评数据集规模并引入更多先进的评估指标帮助用户更精准地选择适合特定任务的过采样技术。【免费下载链接】smote_variantsA collection of 85 minority oversampling techniques (SMOTE) for imbalanced learning with multi-class oversampling and model selection features项目地址: https://gitcode.com/gh_mirrors/smo/smote_variants创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表