缺失数据插补方法详解
1. 缺失数据概述
在大多数数据源中,缺失数据是一个不可避免的问题。缺失数据指的是某些观测值缺少数值。部分机器学习模型可以直接处理缺失数据,但对于其他模型,我们需要移除包含缺失数据的观测值,或者将缺失值转换为允许的值。
将缺失数据用统计估计值替换的操作称为插补,其目标是生成一个完整的数据集。插补方法有多种,我们需要根据数据是否随机缺失、缺失值的比例以及打算使用的机器学习模型来选择合适的插补方法。常见的插补方法如下:
- 移除包含缺失数据的观测值
- 执行均值或中位数插补
- 插补分类变量
- 用任意数字替换缺失值
- 寻找用于插补的极值
- 标记插补值
- 实现前向和后向填充
- 进行插值
- 通过链式方程执行多元插补
- 用最近邻估计缺失数据
技术要求
在处理缺失数据时,我们会使用到以下 Python 库:Matplotlib、pandas、NumPy、scikit-learn 和 Feature-engine。
如果需要安装 Python,可以使用免费的 Anaconda Python 发行版(https://www.anaconda.com/),它包含了大多数数值计算库。
安装 Feature-engine 可以使用以下命令:
- 使用 pip 安装:
pip install feature-engine
- 使用 Anaconda 安装: </
超级会员免费看
订阅专栏 解锁全文

8028

被折叠的 条评论
为什么被折叠?



