文章目录
1.数据集介绍:
数据集(客户违约数据集)所有行列都有缺失值,一共有六个变量,1001条记录

2.制造缺失值数据
#读入数据集
data=pd.read_excel("E:\机器学习数据\miceforest.xlsx")
#使用miceforest来对完整数据随机截取缺失值
A_data_missing=mf.ampute_data(data.iloc[:,1:6],perc=0.25,random_state=1)
#输出缺失百分比
print(A_data_missing.isnull().sum()/len(data))
输出缺失数据所占百分比:
月收入 0.255
年龄 0.259
性别 0.256
历史授信额度 0.262
历史违约次数 0.260
信用评分 0.261
对数据前6列除“是否违约记录”外进行缺失值处理,并使其百分比占25%
3.缺失值插补
3.1单一插补
# 使用单一值插补
kds = mf.ImputationKernel(
data=A_data_missing,
datasets=1,#dataset=1,就是缺失值插补
save_models=1,#取值大于等于0,当等于1时表明只保留获得的最后结果的模型
save_all_iterations=True,#保留所有的中间结果
random_state=10
)
3.2多重插补
# 使用多重插补
kds = mf.ImputationKernel(
data=A_data_missing,
datasets=4,
save_models=1,#取值大于等于0,当等于1时表明只保留获得的最后结果的模型
save_all_iterations=True,#保留所有的中间结果
random_state=10
)
kds.mice(iterations=

该篇博客介绍了如何使用miceforest库对数据集中的缺失值进行处理,包括单一插补和多重插补。涉及的方法有GBDT、泊松分布、均值预测等,还讨论了多分类数据的插补策略以及如何利用已训练模型进行快速填充。此外,文中提到了使用PMM均值预测和自定义插补程序,并探讨了多重插补后的数据筛选和使用。

9974

被折叠的 条评论
为什么被折叠?



