更新于
2026年8月21日
收敛#
术语解释#
在机器学习或深度学习中,收敛(Convergence) 通常指一个迭代过程经过若干步之后,参数、目标函数值或概率分布逐步逼近某个稳定的极限,而不再发生显著变化的状态。
最常见的语境是优化收敛,即使用梯度下降、随机梯度下降、Adam 等优化算法最小化损失函数时,每一轮迭代都在更新模型参数 $\theta$;当损失 $L(\theta)$ 或参数 $\theta$ 的变化幅度连续多轮低于某个阈值时,就称训练过程收敛了。
如图所示,模型大约在25次迭代后目标函数就开始进入收敛状态。
形式上,如果一个序列 $\{x_t\}$ 满足
$$ \lim_{t \to \infty} x_t = x^\star $$就称序列收敛到极限 $x^\star$。
需要强调的是,收敛不等于找到全局最优。多数机器学习或深度学习模型只能保证收敛到局部极小点或鞍点附近,是否真正达到全局最优取决于损失面的结构与优化器的初始化。
影响#
-
是判断训练是否成功的核心信号
训练曲线(loss/accuracy vs epoch)的水平段几乎是判断再训练下去还有没有意义的最直接依据。一旦训练集和验证集 loss 都稳定不再下降、且二者差距较小,就说明模型已经达到当前架构与数据下的性能天花板——可以提前停止(early stopping)节省算力。
-
不收敛 = 模型没在学
如果 loss 在前几轮就开始发散(数值上溢)或者始终停在接近初始值的水平,意味着学习率、初始化或数据预处理出了问题。不收敛是机器学习 debug 时最常见的红灯信号之一,需要先排查:
-
学习率过大(震荡甚至发散)→ 调小
-
损失函数设计不当(梯度消失)→ 切换激活函数或归一化
-
数据未做归一化 → 标准化输入
-
标签错误 / 数据泄露 → 检查 pipeline
-
相关术语#
-
梯度下降
-
优化器
-
学习率
-
Early Stopping