更新于 2026年8月10日

欠拟合#


术语解释#

欠拟合(Underfitting) 是机器学习中3种模型拟合状态(过拟合、欠拟合、恰拟合)中的一种,指模型无法较好地拟合现有的训练数据,导致在训练集和测试集(未知数据)上的误差都很大,是与过拟合相对的另一端问题。

正弦样本点拟合图形
正弦样本点拟合图形

如果所示中的蓝色直线,便是典型的欠拟合状态。原始数据呈正弦分布状态,而该模型拟合得到的却是一条直线。

更多相关内容可参见「4.3 过拟合处理方法:常见原因、表现与正则化实战」


出现原因#

欠拟合通常发生在模型过于简单,不足以捕捉数据背后的复杂规律时的情况,包括:

  • 模型复杂度过低:例如,当数据本身呈现复杂的非线性关系(如正弦曲线)时,如果仅使用简单的线性模型进行拟合,就会出现欠拟合。在深度学习中,这可能表现为网络层数过少或每层神经元数量不足。

  • 特征维度不足:如果收集或设计的特征数量过少,模型由于缺乏足够的输入信息作为参考,无法建立起准确的预测映射关系。

  • 正则化参数过大:在目标函数中施加的惩罚系数(如 $\lambda$)过大,会过度限制模型参数的取值,使其为了追求极简的参数而丧失了对数据基本规律的拟合能力。


优点缺点#

缺点:

  • 高偏差(High Bias):欠拟合模型的主要误差来源于较高的偏差。这意味着预测值的期望与真实值之间存在巨大的差距,模型对数据的理解本身就是错误的。

  • 预测性能糟糕:由于模型在训练阶段就没能学到东西,它在训练集和测试集上的表现通常都非常糟糕,进而无法投入到实际的使用中。

  • 缺乏学习能力:欠拟合模型就像是一个“还没开窍”的学生,无论给它多少数据,它都无法识别出数据中潜在的模式(Pattern)。


相关术语#

  • 过拟合

  • 欠拟合

  • 正则化

阅读 --

4.3 过拟合

在这节中,我们首先介绍了什么是拟合,进而介绍了拟合后带来的3种状态,即欠拟合、恰拟合与过拟合,其中恰拟合的模型是我们最终所需要的结果。接着,我们介绍了解决欠拟合与过拟合的几种方法,其中解决过拟合的两种具体方法将在后续的内容中分别进行介绍。