更新于 2026年8月10日

正则化#


术语解释#

正则化(Regularization) 是机器学习和深度学习中通过在原始目标函数中添加一个惩罚项(Regularization Term),来约束模型参数、降低模型复杂度的技术,其目的是在拟合训练数据的同时提升模型的泛化能力。。常见的正则化方法包括 $\mathcal{l}_2$ 正则化(又称岭回归或权重衰减)和 $\mathcal{l}_1$ 正则化(又称套索回归)。

例如在线性回归的目标函数后面再加上一个$\mathcal{l}_2$ 正则化项那将会得到如下形式的目标函数

$$ J=\frac{1}{2m}\sum\limits_{i=1}^{m}{{{\left( {{y}^{(i)}}-(\sum\limits_{j=1}^{n}{{{w}_{j}}x_{j}^{(i)}}+b) \right)}^{2}}}+\frac{\lambda }{2n}\sum\limits_{j=1}^{n}{{{({{w}_{j}})}^{2}}};\;\;(\lambda >0) $$

在式子中的第2项便是新加入的 $\mathcal{l}_2$ 正则化项,同时我们也称包含 $\mathcal{l}_2$ 正则化项的线性回归为岭回归(Ridge Regression)。

根据「第2.1.3节 线性回归模型的建立与求解:原理、公式与训练过程」中的内容可知,当真实值与预测值之间的误差越小(表现为损失值趋于0)时,也就代表着模型的预测效果越好,并且可以通过最小化目标函数来达到这一目的。由上面的式子可知,为了最小化目标函数$J$,第2项的结果也必将逐渐地趋于0。这使最终优化求解得到的$w_j$均会趋于0附近,进而得到一个平滑的预测模型。

此时当某个新输入样本(含噪声)的某个特征维度由训练时的 $x_j$ 变成了现在的 $(x_j+\Delta x_j)$,那么其预测输出就由训练时的 $\hat{y}$ 变成了现在的 $\hat{y}+\Delta x_jw_j$,即产生了 $\Delta x_jw_j$ 的误差,但是,由于 $w_j$ 接近于 $0$ 附近,所以这使模型最终只会产生很小的误差。同时,如果 $w_j$ 越接近于 $0$,则产生的误差就会越小,这意味着模型越能够抵抗噪声的干扰,在一定程度上越能提升模型的泛化能力。 更多相关内容可参见「4.4 L1与L2正则化原理:权重衰减与过拟合抑制」


出现动机#

  • 缓解过拟合风险:当模型过于复杂(如多项式次数过高或网络层数过多)时,模型会过度拟合训练数据中的随机噪声而非真实规律,导致在训练集上误差极小但在测试集上表现糟糕。

  • 降低模型复杂度:正则化的初衷是让模型权重参数尽可能趋近于 0 附近,从而得到一个更加平滑的预测模型。

  • 平衡偏差与方差:通过引入惩罚项,人为干预模型在训练过程中的参数更新,旨在牺牲一部分训练精度来换取更强的泛化能力。


优点缺点#

  • 优点:

    • 增强泛化能力:正则化能显著降低模型在未知数据上的泛化误差,使模型不再对噪声数据异常敏感。

    • 提高模型稳定性:由于权重参数较小,输入中的微小偏差对预测结果的影响会被缩小,模型更具鲁棒性。

    • 产生稀疏解与特征选择(针对 $\mathcal{l}_1$):$\mathcal{l}_1$ 正则化更容易让不重要的特征参数直接变为 0,从而实现自动的特征筛选,减少冗余特征。

      $\mathcal{l}_1$ 和 $\mathcal{l}_2$ 两种正则化约束条件下目标函数对应的最优解
      $\mathcal{l}_1$ 和 $\mathcal{l}_2$ 两种正则化约束条件下目标函数对应的最优解
  • 缺点:

    • 引发欠拟合风险:如果惩罚系数 $\lambda$ 设置过大,会对模型参数施加过度限制,导致模型连数据中的基本规律都无法拟合,产生高偏差。

    • 增加训练误差:正则化虽然优化了测试表现,但往往会以增加训练集上的损失值为代价。

    • 超参数调节困难:惩罚系数 $\lambda$ 是一个关键的超参数,其最优值的选取通常需要依赖交叉验证过程。


相关术语#

  • 过拟合

  • $\mathcal{l}_1$ 正则化

  • $\mathcal{l}_2$ 正则化

阅读 --

4.4 正则化

在这节内容中,我们首先通过示例详细介绍了如何通过$\mathcal{l}_2$正则化方法来缓解模型的过拟合现象,以及介绍了为什么$\mathcal{l}_2$正则能够使模型变得更简单;其次介绍了加入正则化后原有梯度更新公式的变化之处,其仅仅 …

4.3 过拟合

在这节中,我们首先介绍了什么是拟合,进而介绍了拟合后带来的3种状态,即欠拟合、恰拟合与过拟合,其中恰拟合的模型是我们最终所需要的结果。接着,我们介绍了解决欠拟合与过拟合的几种方法,其中解决过拟合的两种具体方法将在后续的内容中分别进行介绍。

3.10 过拟合与正则化

经过前面几节内容的介绍, 我们对于深度学习的理念以及最基本的回归和分类模型已经有了清晰的认识。在接下来的这节内容中,我们将逐步开始介绍深度学习中关于模型优化的一些基本内容,包括模型的过拟合、正则化和丢弃法等。