偏差与方差#
术语解释#
在机器学习和深度学习的建模过程中,偏差(Bias)与方差(Variance)是衡量模型泛化误差的两个核心指标。
-
偏差 (Bias):描述的是预测值的期望与真实值之间的差距。偏差越大,说明模型的预测结果越偏离真实目标。
-
方差 (Variance):描述的是预测值之间的变化范围和离散程度(即离其期望值的距离)。方差越大,说明模型输出的分布越分散,对数据的微小变动越敏感。

如果把射击红色的靶心比作训练模型,高偏差意味着子弹整体密集地打在靶心旁边(距离靶心远);高方差则意味着子弹散乱地分布在靶心周围。
更多相关内容可参见「4.5 偏差和方差:交叉验证、过拟合与模型泛化」。
出现动机#
模型总的泛化误差(Generalization Error)普遍来自于偏差或方差。引入这两个概念是为了科学地分析模型在未知数据集上产生误差的原因。通过偏差和方差的分析,我们可以有效判断模型是处于欠拟合(高偏差)还是过拟合(高方差)状态。知道误差来源后,才能有针对性地调整模型。例如,高偏差模型需要增加复杂度,而高方差模型则需要正则化或增加数据量。
模型选择的目的便是尽可能选择一个较好的模型,以达到低偏差与低方差之间的平衡(即“恰拟合”状态)。 此时,为了准确评估模型的偏差与方差并避免数据集划分的偶然性,通常可以使用 K折交叉验证(KFold Cross Validation) 来辅助选择平均误差最小的模型。

优点缺点#
在实际建模中,偏差与方差往往呈现此消彼长的关系,两者各有利弊。
-
对于低复杂度的模型(通常具有高偏差、低方差)来说:
-
优点:具有低方差,这意味着模型对训练数据中的随机噪声不敏感,预测结果相对稳定,不容易产生过拟合现象。
-
缺点:具有高偏差,模型过于简单,不足以捕捉数据背后的复杂规律,导致模型在训练集和测试集上的表现都糟糕,处于欠拟合状态。
-
-
对于高复杂度模型(通常具有低偏差、高方差)来说:
-
优点:具有低偏差,模型表达能力强,能够拟合更多的样本点,甚至在训练集上达到极低的误差。
-
缺点:具有高方差,模型对训练数据中的噪声异常敏感。虽然在训练集上表现很好,但在测试集(未知数据)上误差很大,即泛化能力弱,处于过拟合状态。
-
相关术语#
-
交叉验证
-
过拟合
-
欠拟合
-
正则化