过拟合#
术语解释#
过拟合(Overfitting) 是机器学习和深度学习中一种常见的现象,指的是模型在训练集上表现很好(误差很小),但在测试集或未知数据上表现糟糕(误差很大)的现象。一个形象的比喻就是模型「死记硬背」训练数据,因此在训练集上能够取得很好的效果,但是在新数据上表现很差的现象。
例如在回归任务中,过拟合通常表现为拟合曲线异常曲折,为了强行经过每一个样本点(包括噪声点)而变得非常复杂。

在上图中,绿色线条表示的就是一条过拟合的曲线,它完美无误地拟合到了训练集中的每一个样本点。但是,如果此时用新的测试集来验证模型的效果,将会得到下面这样的结果。

在上图中,绿色线条对应的便是模型在测试集上的结果,原本正弦分布的样本此时变成了一个扭曲的曲线。更多相关内容可参见「4.3 过拟合处理方法:常见原因、表现与正则化实战」。
出现原因#
-
训练数据中存在噪声:现实中的数据往往包含干扰信息。如果模型为了极力追求在训练集上的低误差,试图拟合每一个样本点,就会受到噪声的严重影响。
-
模型过于复杂:当模型的复杂度(如多项式次数过高、网络层数过多或神经元数量过大)远远超过了解决问题所需的程度时,极易产生过拟合。例如,在样本点本应符合正弦曲线的情况下,使用 10 次多项式进行拟合会导致模型在训练点之间产生剧烈波动。
-
训练数据量过少:如果数据规模不足以支撑复杂模型的参数学习,模型就更容易通过“记住”有限的样本来降低训练误差,从而丧失对新数据的处理能力。
优点缺点#
- 缺点:
-
泛化能力低:这是过拟合最显著的缺点。模型在实际应用或面对从未见过的数据时,预测效果会大幅度下降。
-
对噪声异常敏感:由于模型学习了噪声规律,输入中微小的偏差(如 $\Delta x_j$)都可能被权重参数放大,从而导致预测输出产生巨大的错误。
-
误导决策:在某些场景下(如大语言模型),过拟合可能表现为“幻觉”——模型看起来逻辑自洽且自信,但实际上是在一本正经地胡说八道,其事实性和逻辑性并不可靠。
-
相关术语#
-
欠拟合
-
恰拟合