Table of Contents
过度适应和不适应是机器学习模型中常见的问题。它们影响模型从培训数据到无形数据的一般化能力。理解它们的数学基础有助于设计更好的模型和选择适当的解决方案。
数学基础
当一个模型不仅学习了基础规律,而且学习了训练数据中的噪音时,就会发生过度适应. 数学上,它导致训练错误低,但新数据上的错误高. 不太适应的情况是,模型过于简单,无法捕捉数据的结构,导致训练和测试数据都出现高错误.
偏差-偏差权衡可以解释这些现象. 高偏差模型往往不适应,而高偏差模型往往过于适应. 平衡偏差和偏差对于模型的最佳性能至关重要.
数学指标
平均方格错误(MSE)和交叉验证分数等计量方法有助于识别过度配和不足。训练与验证错误之间的巨大差距表明偏差。相反,两个数据集的高差表明偏差。
解决方案和技术
几种方法解决了过度配装和不适配的问题,L1和L2等规范化技术在模型复杂度中增加了罚单,交叉验证有助于调制超参数,简化模型可以减少过度配装,同时不断提高的复杂度可以减轻不适配度.
- 正规化
- 交叉验证
- 特性选择
- 模型复杂性调整
- 数据扩充