miceforest插补

该篇博客介绍了如何使用miceforest库对数据集中的缺失值进行处理,包括单一插补和多重插补。涉及的方法有GBDT、泊松分布、均值预测等,还讨论了多分类数据的插补策略以及如何利用已训练模型进行快速填充。此外,文中提到了使用PMM均值预测和自定义插补程序,并探讨了多重插补后的数据筛选和使用。

1.数据集介绍:

数据集(客户违约数据集)所有行列都有缺失值,一共有六个变量,1001条记录
在这里插入图片描述

2.制造缺失值数据

#读入数据集
data=pd.read_excel("E:\机器学习数据\miceforest.xlsx")
#使用miceforest来对完整数据随机截取缺失值
A_data_missing=mf.ampute_data(data.iloc[:,1:6],perc=0.25,random_state=1)
#输出缺失百分比
print(A_data_missing.isnull().sum()/len(data))

输出缺失数据所占百分比:

月收入       0.255
年龄        0.259
性别        0.256
历史授信额度    0.262
历史违约次数    0.260
信用评分      0.261

对数据前6列除“是否违约记录”外进行缺失值处理,并使其百分比占25%

3.缺失值插补

3.1单一插补

# 使用单一值插补
kds = mf.ImputationKernel(
  data=A_data_missing,
  datasets=1,#dataset=1,就是缺失值插补
  save_models=1,#取值大于等于0,当等于1时表明只保留获得的最后结果的模型
  save_all_iterations=True,#保留所有的中间结果
  random_state=10
)

3.2多重插补

# 使用多重插补
kds = mf.ImputationKernel(
  data=A_data_missing,
  datasets=4,
  save_models=1,#取值大于等于0,当等于1时表明只保留获得的最后结果的模型
  save_all_iterations=True,#保留所有的中间结果
  random_state=10
)
kds.mice(iterations=
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值