更新于 2026年8月21日

偏置#


术语解释#

在机器学习和深度学习模型中,偏置(Bias)是一个至关重要的模型参数,通常用字母 $b$ 表示,如线性回归 $\hat{y}=wx+b$ 中的 $b$,同时,它也被称为截距(Intercept)。

在多变量线性回归或神经网络中,权重 $W$ 通常是一个向量,而偏置 $b$ 则是一个标量。 偏置项的主要作用是对模型进行全局偏移或平移,它与权重一起参与梯度更新,是几乎所有神经网络层的基本组成。如果没有偏置项,回归直线或分类超平面将强制通过坐标原点。

但在实际问题中,当输入特征为零时,输出往往不为零(例如房价预测中,面积为零并不代表价格基准为零),因此偏置项能让模型灵活地调整位置以匹配数据。

同时,在早期的神经元模型中,偏置可以看作是一种阈值控制单元,用于决定神经元在何种输入强度下被“激活”。


优点缺点#

  • 优点:

    • 增强模型拟合能力:通过允许超平面在特征空间中自由移动,显著提升了模型处理复杂数据的灵活性。

    • 不易导致过拟合:偏置项仅控制模型的全局平移,而不影响各个特征之间的相对比例关系,因此它通常不会导致过拟合。

    • 简化正则化操作:基于其不易引起过拟合的特性,在进行 $l_1$ 或 $l_2$ 正则化时,通常不需要对偏置项进行正则化(惩罚)。

  • 缺点:

    • 贡献度相对较小:在某些复杂的归一化场景中,偏置项(或其对应的平移不变性)被认为对模型效果的贡献有限。例如 RMSNorm 算法的提出动机就是认为 LayerNorm 中的“去均值(减去偏置效应)”操作虽然耗时,但对降低方差并没有实质性作用,因此在追求效率的大模型(如 LLaMA、DeepSeek)中常被移除。相关内容可参见文章「RMSNorm 归一化原理与 PyTorch 实现:详解与 LayerNorm 的区别及在 LLaMA/DeepSeek 中的应用」

    • 无法捕捉特征间关系:偏置是一个固定偏移量,它不随输入数据的变化而变化,因此无法像权重 $w$ 那样捕捉特征与输出之间的比例逻辑。

    • 潜在的计算开销:在超大规模并行计算(如张量并行)中,管理和同步每一个线性层的偏置项会带来微小的额外通信和内存开销。因此在某些大模型的线性层(如 ColumnParallelLinear)设计中,有时会选择不使用偏置(bias=False)来追求极致的效率。

阅读 --

3.4 从零实现回归模型

在本节内容中,我们首先通过一个两层的神经网络来回顾和梳理了前向传播的详细计算过程;然后根据上节中介绍的内容推导出了模型在反向传播过程中权重参数的梯度计算公式;最后,一步一步详细地介绍了如何从零开始实现这个两层神经网络,包括模型的正向传播和反 …

3.7 从零实现分类模型

在本节内容中,我们首先通过一个3层的神经网络来回顾和梳理了分类模型前向传播的详细计算过程;然后根据3.3节中介绍的内容导出了模型在反向传播过程中权重参数的梯度计算公式;