正则化#
术语解释#
正则化(Regularization) 是机器学习和深度学习中通过在原始目标函数中添加一个惩罚项(Regularization Term),来约束模型参数、降低模型复杂度的技术,其目的是在拟合训练数据的同时提升模型的泛化能力。。常见的正则化方法包括 $\mathcal{l}_2$ 正则化(又称岭回归或权重衰减)和 $\mathcal{l}_1$ 正则化(又称套索回归)。
例如在线性回归的目标函数后面再加上一个$\mathcal{l}_2$ 正则化项那将会得到如下形式的目标函数
$$ J=\frac{1}{2m}\sum\limits_{i=1}^{m}{{{\left( {{y}^{(i)}}-(\sum\limits_{j=1}^{n}{{{w}_{j}}x_{j}^{(i)}}+b) \right)}^{2}}}+\frac{\lambda }{2n}\sum\limits_{j=1}^{n}{{{({{w}_{j}})}^{2}}};\;\;(\lambda >0) $$在式子中的第2项便是新加入的 $\mathcal{l}_2$ 正则化项,同时我们也称包含 $\mathcal{l}_2$ 正则化项的线性回归为岭回归(Ridge Regression)。
根据「第2.1.3节 线性回归模型的建立与求解:原理、公式与训练过程」中的内容可知,当真实值与预测值之间的误差越小(表现为损失值趋于0)时,也就代表着模型的预测效果越好,并且可以通过最小化目标函数来达到这一目的。由上面的式子可知,为了最小化目标函数$J$,第2项的结果也必将逐渐地趋于0。这使最终优化求解得到的$w_j$均会趋于0附近,进而得到一个平滑的预测模型。
此时当某个新输入样本(含噪声)的某个特征维度由训练时的 $x_j$ 变成了现在的 $(x_j+\Delta x_j)$,那么其预测输出就由训练时的 $\hat{y}$ 变成了现在的 $\hat{y}+\Delta x_jw_j$,即产生了 $\Delta x_jw_j$ 的误差,但是,由于 $w_j$ 接近于 $0$ 附近,所以这使模型最终只会产生很小的误差。同时,如果 $w_j$ 越接近于 $0$,则产生的误差就会越小,这意味着模型越能够抵抗噪声的干扰,在一定程度上越能提升模型的泛化能力。 更多相关内容可参见「4.4 L1与L2正则化原理:权重衰减与过拟合抑制」。
出现动机#
-
缓解过拟合风险:当模型过于复杂(如多项式次数过高或网络层数过多)时,模型会过度拟合训练数据中的随机噪声而非真实规律,导致在训练集上误差极小但在测试集上表现糟糕。
-
降低模型复杂度:正则化的初衷是让模型权重参数尽可能趋近于 0 附近,从而得到一个更加平滑的预测模型。
-
平衡偏差与方差:通过引入惩罚项,人为干预模型在训练过程中的参数更新,旨在牺牲一部分训练精度来换取更强的泛化能力。
优点缺点#
-
优点:
-
增强泛化能力:正则化能显著降低模型在未知数据上的泛化误差,使模型不再对噪声数据异常敏感。
-
提高模型稳定性:由于权重参数较小,输入中的微小偏差对预测结果的影响会被缩小,模型更具鲁棒性。
-
产生稀疏解与特征选择(针对 $\mathcal{l}_1$):$\mathcal{l}_1$ 正则化更容易让不重要的特征参数直接变为 0,从而实现自动的特征筛选,减少冗余特征。
$\mathcal{l}_1$ 和 $\mathcal{l}_2$ 两种正则化约束条件下目标函数对应的最优解
-
-
缺点:
-
引发欠拟合风险:如果惩罚系数 $\lambda$ 设置过大,会对模型参数施加过度限制,导致模型连数据中的基本规律都无法拟合,产生高偏差。
-
增加训练误差:正则化虽然优化了测试表现,但往往会以增加训练集上的损失值为代价。
-
超参数调节困难:惩罚系数 $\lambda$ 是一个关键的超参数,其最优值的选取通常需要依赖交叉验证过程。
-
相关术语#
-
过拟合
-
$\mathcal{l}_1$ 正则化
-
$\mathcal{l}_2$ 正则化