K-Fold交叉验证

zoukankan html css js c++ java

K-Fold交叉验证

1.K-Fold 交叉验证概念

在机器学习建模过程中，通行的做法通常是将数据分为训练集和测试集。测试集是与训练独立的数据，完全不参与训练，用于最终模型的评估。在训练过程中，经常会出现过拟合的问题，就是模型可以很好的匹配训练数据，却不能很好在预测训练集外的数据。如果此时就使用测试数据来调整模型参数，就相当于在训练时已知部分测试数据的信息，会影响最终评估结果的准确性。通常的做法是在训练数据再中分出一部分做为验证(Validation)数据，用来评估模型的训练效果。

验证数据取自训练数据，但不参与训练，这样可以相对客观的评估模型对于训练集之外数据的匹配程度。模型在验证数据中的评估常用的是交叉验证，又称循环验证。它将原始数据分成K组(K-Fold)，将每个子集数据分别做一次验证集，其余的K-1组子集数据作为训练集，这样会得到K个模型。这K个模型分别在验证集中评估结果，最后的误差MSE(Mean Squared Error)加和平均就得到交叉验证误差。交叉验证有效利用了有限的数据，并且评估结果能够尽可能接近模型在测试集上的表现，可以做为模型优化的指标使用。

作者：小宋是呢
链接：https://zhuanlan.zhihu.com/p/67986077
来源：知乎
著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。

查看全文

相关阅读:
【学习】reactjs（一）——使用npm创建react项目并整合elementUI
【学习】整合springboot2.0 和 mybatis，实现基本的CRUD
macos monterey 系统升级后 go build 错误
 [R语言]关联规则2---考虑items之间严格的时序关系
 [R语言]关联规则1---不考虑items之间的时序关系
 [python]使用python实现Hadoop MapReduce程序：计算一组数据的均值和方差
 [机器学习笔记]奇异值分解SVD简介及其在推荐系统中的简单应用
 [机器学习笔记]主成分分析PCA简介及其python实现
 [游戏数据分析]WAU模型简介及WAU预测
 [R语言]读取文件夹下所有子文件夹中的excel文件，并根据分类合并。

原文地址：https://www.cnblogs.com/yibeimingyue/p/14874279.html

K-Fold交叉验证

1.K-Fold 交叉验证概念