线性回归#
术语解释#
线性回归(Linear Regression)是机器学习中最基础且经典的有监督学习算法,主要用于解决回归类问题,即对连续数值进行预测。例如对房价进行预测。

线性回归通过建立一个线性数学模型来描述特征变量 $x$ 与目标变量 $y$ 之间的映射关系,其基本形式为
$$ \hat{y} = wx + b $$或多变量
$$ \hat{y} = w^Tx + b $$其中 $w$ 为权重参数(Weight),$b$ 为偏置(Bias)。相关内容可以参见 「2.1 线性回归模型的建立与求解:原理、公式与训练过程」。
在深度学习视角下,线性回归可以被看作是一个单层神经网络,其输出层是一个全连接层。它通过最小化目标函数(如均方误差 MSE)来求解最优参数,使预测值尽可能接近真实值。

其中$x_1,x_2,x_3,x_4$表示输入的4项房屋信息特征,$w_1,w_2,w_3,w_4$表示每个特征对应的权重参数,$b$ 为偏置。 相关内容可以参见「 3.1 深度学习线性回归入门:多项式回归与神经网络建模基础」。
出现动机#
在线性增长趋势明显的场景(如根据房屋面积预测房价)中,需要一种科学的方法来建立预测模型。 同时,在处理不共线的散点数据时(如上图所示的房间数据),无法直接求解方程,因此可以引入“均方误差”等指标来间接刻画模型的准确性,将参数求解转化为优化问题,最终得到一条处于各样本点“中间”的直线。
优点缺点#
-
优点:
-
高效且直观:线性回归的目标函数通常是凸函数,这意味着可以使用梯度下降算法高效地找到全局最优解。
-
数学基础稳固:它建立在概率论基础上。高斯证明了当测量误差服从正态分布时,最小二乘法能得到最优参数估计。
-
-
缺点:
-
线性假设的局限:模型本质上是线性的,无法直接处理复杂的非线性关系,除非进行手动的特征映射(如转化为多项式回归)。
-
对量纲/特征范围敏感:如果不同特征的取值范围差异过大,会导致目标函数的等高线呈现椭圆形,从而使梯度下降的收敛速度变慢,因此需要标准化。
-
对异常值敏感:由于使用了误差的平方,偏离较大的噪声点会产生巨大的损失贡献,从而显著拉偏拟合的直线。
-
相关术语#
-
逻辑回归
-
多变量线性回归
-
多项式回归