Table of Contents
交叉验证是一种用来评价机器学习模型的性能的技术,它通过估计模型在无形数据上的表现如何来帮助调试模型参数。这一过程包括将数据集分为多个部分,对模型进行某些部分的培训,并在其他部分进行测试。本条解释了模型调试时跨验证错误的逐步计算。
步骤1:数据分区
数据集分为“ k” 等元部分, 称为“ k” 。 “ k” 的常见选择是 5 或 10 。 每个折叠都起到验证集的作用, 而其余的折叠则构成训练集。 这个过程确保每个数据点都用于培训和验证。
步骤2:示范培训和鉴定
对于每个折叠,模型在剩下的'k-1'折叠上训练,然后在当前折叠上验证。错误是根据模型的预测值与验证折叠中的实际值比较计算出来的。对所有折叠都重复这一步骤。
步骤3:错误计算
记录每个折叠的错误。常见的错误度量包括平均平方差错(MSE)或平均绝对差错(MAE)。交叉验证错误是所有折叠的这些差错的平均值,提供了模型性能的估计值。
步骤4:最后错误估计
从交叉验证过程中获得的平均误差, 是对模型如何在新的、 看不见的数据上运行的估计。 这个值指导了调试时选择最佳模型参数 。