数据挖掘与机器学习中的关键技术:验证、优化与搜索策略
在数据挖掘和机器学习(DMML)领域,评估模型性能和进行优化搜索是至关重要的环节。本文将详细介绍两种常用技术——交叉验证(Cross - Validation)和不同类型的搜索策略,包括单变量搜索和多变量搜索。
交叉验证
在评估模型的预测准确性时,理想的做法是保留一部分数据作为测试集,用其余数据训练模型,然后用训练好的模型对测试集进行预测。然而,在实际应用中,数据往往是有限的,因此需要一种折中的方法,这就是交叉验证。
K 折交叉验证
K 折交叉验证是最常见的交叉验证方法,其具体步骤如下:
1. 随机划分样本 :将随机样本 xxx = (x1,···,xn) 随机分成 K 个相等的部分。
2. 模型训练 :对于 i = 1, …, K,依次保留第 i 部分作为验证集,用其余的数据训练模型。
3. 预测验证集 :使用训练好的模型对保留的第 i 部分进行预测。
4. 计算平均预测准确性 :将 K 次不同训练得到的预测准确性进行平均。
对于每个需要评估的模型,都重复上述步骤,然后选择误差最小的模型。预测准确性的衡量指标取决于具体的问题,例如在回归问题中可能是预测均方误差,在分类问题中可能是错误分类的数量。
在选择 K 值时,需要进行权衡。如果 K = n,即“留一法”(leave - one - out,loo)交叉验证,此时偏差较小,但预测准确性的方差可能较大,并且计算量很大。因为
超级会员免费看
订阅专栏 解锁全文

32

被折叠的 条评论
为什么被折叠?



