线性回归基础概念#
原页面: https://developers.google.com/machine-learning/crash-course/linear-regression
「线性回归」是一种用于寻找变量之间关系的统计技术。在机器学习这一场景中,线性回归用于寻找「特征」与「标签」之间的关系。
例如,假设我们想根据汽车的重量预测其燃油效率,即每加仑可行驶的英里数,并有以下数据集:
| 重量(千磅)(特征) | 每加仑英里数(标签) |
|---|---|
| 3.5 | 18 |
| 3.69 | 15 |
| 3.44 | 18 |
| 3.43 | 16 |
| 4.34 | 15 |
| 4.42 | 14 |
| 2.37 | 24 |
如果绘制这些数据点,我们将会得到下图所示的结果:
进一步,我们可以在数据点之间绘制一条最佳拟合直线,从而创建自己的模型:
线性回归方程#
用代数术语表示,该模型可以写为 $ y = mx + b $,其中:
-
$ y $ 表示每加仑英里数,也就是我们希望预测的值。
-
$ m $ 表示直线的斜率。
-
$ x $ 表示磅数,也就是我们的输入值。
-
$ b $ 表示纵轴截距。
在机器学习中,我们会将线性回归模型写成以下形式:
$$ y' = b + w_1x_1 $$其中:
-
$ y' $ 表示预测标签,也就是输出结果。
-
$ b $ 是模型的「偏置」。偏置与直线代数方程中的纵轴截距(Intercept)是同一概念。在机器学习中,偏置有时也记作 $ w_0 $。偏置是模型的「参数」,会在训练过程中计算得出。
-
$ w_1 $ 是特征的「权重」。权重与直线代数方程中的斜率 $ m $ 是同一概念。权重是模型的参数,会在训练过程中计算得出。
-
$ x_1 $ 是一个「特征」,也就是输入。
MLWM:一般来说,模型中的所有可学习的参数都称之为参数或权重,换句话说参数或权重都是指模型中所有可学习的参数,$w$、$b$ 或者其它参数(如 BN)中的 $\gamma$ 和 $\beta$ 等。
在训练过程中,模型会计算出能够产生最佳模型的权重和偏置。
在上面这个示例中,我们会根据绘制的直线计算权重和偏置。偏置为 34(直线与 y 轴相交的位置),权重为 -4.6(直线的斜率)。此时,该模型可以写为 $ y' = 34 + (-4.6)(x_1) $,我们便可以使用它进行预测。
例如,根据这个模型,一辆重 4,000 磅的汽车预计每加仑可行驶 15.6 英里。
包含多个特征的模型#
虽然本节示例只使用了一个特征,也就是汽车的重量,但更复杂的模型可能会使用多个特征,每个特征都有单独的权重($ w_1 $、$ w_2 $ 等)。例如,一个使用五个特征的模型可以写为:
$$ y' = b + w_1x_1 + w_2x_2 + w_3x_3 + w_4x_4 + w_5x_5 $$更多关于多变量线性回归的内容,可以参见机器学习栏目「2.2 多变量线性回归:原理、建模过程与 sklearn 示例」中的讲解。
例如,用于预测汽车燃油里程数的模型还可以使用以下特征:
-
发动机排量
-
加速性能
-
气缸数量
-
马力
该模型可以写为:
此时,当我们绘制其中几个附加特征后,我们可以看到它们与标签“每加仑英里数”也存在线性关系:
检查你的理解情况#
线性回归模型中的哪些部分会在训练过程中更新?
-
A. 特征值
-
B. 预测值
-
C. 偏置和权重
点击查看答案
关键术语: