多类别不平衡大数据分析与儿童兴趣推荐系统
1 多类别不平衡大数据处理方法
1.1 采样方法的局限性与混合采样技术
传统的欠采样和过采样方法都存在一定弊端。欠采样会忽略一些重要实例,降低分类准确性;过采样则会创建额外实例,增加训练时间,还可能导致过拟合。为避免这些问题,混合或集成采样技术应运而生。例如,Cao 等人提出的集成重采样技术,通过 SMOTE 方法进行过采样,OSS 方法进行欠采样。SMOTE 创建人工实例,OSS 去除边界和噪声实例,将处理后的数据集输入分类器并分析结果,该集成技术在解决分类过拟合问题上比 SMOTE 更可行有效。Junsomboon 等人提出的技术结合了两种采样方法来平衡不平衡数据,先使用邻域清理规则(NCL)对多数类进行欠采样去除离群实例,再将结果数据集输入 SMOTE,提高了召回率和准确率。
1.2 算法级方法
采样方法通常需要更多的计算时间和内存空间,对于一些数据量不断增长的领域不太适用。因此,出现了算法级方法:
- SVM 主动学习 :Ertekin 等人提出的 SVM 主动学习方法,从随机选取的较小实例池中选择有信息的实例,处于边界区域的实例构成小实例池。该方法不搜索整个数据集,而是查询系统,能快速解决问题,具有有竞争力的预测性能,还能处理未标记实例。
- 成本敏感的最小均方(LMS)算法扩展 :Belarouci 等人提出的成本敏感的 LMS 算法扩展,通过对不同实例赋予不同权重来惩罚错误,解决数据不平衡问题,平衡后应用不同分类技术,实验结果显示分类准确率有所提高。
- 混沌磷虾群进化算法(
超级会员免费看
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



