国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:孙博,周倩,陈海燕
单位:山东农业大学,山东农业大学,南京航空航天大学
关键词:分类; 类不平衡; 欠采样; 类重叠度; 数据复杂性; 机器学习
基金:山东省自然科学基金项目(ZR2023MF098, ZR2018QF002), 山东省重大科技创新项目(2019JZZY010706)资助.
分类是机器学习中的一项重要学习任务, 基本思想是使用在训练样例集上生成的分类器对测试样例的类别进行预测. 然而, 很多实际应用中的训练集具有不平衡的类分布, 这通常会制约学习算法的分类性能. 为此, 本文提出以类重叠度为优化目标的不平衡数据学习方法 (COA-RBU). 将相对类间势作为多数类样例效用的评价标准,并根据训练集的类重叠度自适应地确定合适欠采样比例, 以降低不平衡训练集的数据复杂性. 实验结果表明, 类重叠度能较好地反映数据集的学习难度, 并且COA-RBU具有良好的性能和较高的效率. 因此, 本文工作从类重叠数据复杂性角度为合适欠采样比例的确定提供了一种新的思路.
来源:2024年第11期
《控制理论与应用》期刊编辑部