AI 术语百科
已收录 87 个,持续增加中……机器学习、深度学习、RAG、Agent、LLM 等 AI 领域常见术语速查,每个词条附带站内文章入口。
B
标准化
ml在机器学习和深度学习中,标准化(Standardization) 是一种关键的预处理技术,旨在将不同特征维度的取值范围调整到相似的尺度,以提高模型训练的稳定性和效率。
贝叶斯定理
ml贝叶斯定理(Bayes' Theorem) 是概率论中的一个基本定理,它描述了在已知一些条件下,某事件发生的概率如何随新证据的出现而更新。在机器学习中,它常被用于构造分类器,即通过先验概率和条件概率来 …
标签传播
ml标签传播(Label Propagation)是基于图结构的半监督学习算法:把样本看作图节点,相似样本间连边并传播标签信息,让未标注节点逐步获得类别标签。它只需少量已标注样本,就能将标签沿图结构扩散到 …
标签
mldlLabel(标签)是监督学习中「正确的输出 / 类别」,即每个样本对应的「标准答案」。模型通过最小化预测与标签的差异来学习参数。
变形器
dlTransformer 是 2017 年 Google 提出的「完全基于注意力机制」的网络结构:抛弃 RNN 的顺序计算,用 Self-Attention 让序列中任意两个位置直接交互,配合位置编码保 …
C
D
迭代
mldl迭代(Iteration)指模型在训练过程中的一次参数更新动作,由 batch size 决定一次处理多少样本后调整权重和偏置。神经网络的一次迭代包含前向传播与反向传播两个过程。
多项式贝叶斯
ml多项式贝叶斯(Multinomial Naive Bayes, MNB)以多项式分布建模特征条件概率,适合处理「词频」「点击次数」这类非负离散计数特征,是文本分类(垃圾邮件、新闻分类)中最常用的朴素贝 …
多项式回归
ml多项式回归(Polynomial Regression)是线性回归的扩展:通过在特征中加入高次项(如 $x^2, x^3$)或交叉项,用线性模型拟合非线性关系。它形式上仍是线性回归,但能逼近曲线,是入 …
F
G
H
J
决策边界
dlml决策边界(Decision Boundary),也常被称为决策面,是机器学习分类模型中用于区分不同类别的边界。在特征空间中,模型根据这条边界来判定新样本的所属类别。
决策树
ml决策树(Decision Tree)是一类基于「if-else 规则」建模的树形模型:从根节点出发,每一层按某个特征的某个阈值把样本分流到左右子节点,直到叶节点给出最终的类别或回归值。常见算法有 …
集成学习
ml集成学习(Ensemble Learning) 是一种通过结合多个基模型来提高整体泛化能力的机器学习方法。其核心思想类似于俗语“三个臭皮匠,赛过诸葛亮”,即通过多个模型的组合来弥补单个模型在特定样本上 …
激活函数
dl激活函数(Activation Function)是神经网络中每个神经元上的非线性变换,常见的有 Sigmoid、Tanh、ReLU、LeakyReLU、GELU、Swish 等。它把线性加权和映射到 …
均方误差
mlMSE(均方误差,Mean Squared Error)是回归任务最常用的损失 / 评估指标:预测值与真实值之差的平方的平均数。它对应「误差服从高斯分布」的最大似然估计,几何意义是「预测点到真实点的欧 …
决定系数
ml决定系数(Coefficient of Determination),通常记为 $R^2$,是回归任务中衡量模型拟合优劣的一种核心评估指标。
均方根误差
mlRMSE(均方根误差)是 MSE 的平方根,把量纲还原到与原始数据一致,是回归评估里最常用的「直读型」指标。它与 MSE 同性质但更易解释:例如「房价预测 RMSE=50 万」意味着平均误差约 50 …
交叉验证
ml交叉验证(Cross Validation)是把数据集切分成 K 份,轮流用 K-1 份训练、1 份验证,最终取 K 次平均性能作为模型评估指标的策略。K 折交叉验证(K-Fold)是其中最常见的实现 …
机器学习
mlMachine Learning(机器学习,ML)是 AI 的核心子领域:通过让系统从数据中学习规律与模式,而不是显式编程,来完成任务。它包含监督学习、无监督学习、半监督学习、强化学习等范式,是当代 …
聚类
mlClustering(聚类)是无监督学习的核心任务:把相似样本自动归到同一组,让组内相似、组间差异。常见算法有 K-Means、层次聚类、DBSCAN、谱聚类等。
加权Kmeans
ml加权 Kmeans# 术语解释# 加权 Kmeans(Weighted Kmeans, WKmeans) 是一种基于 Kmeans 框架改进的聚类算法。它通过给每个特征维度赋予权重,来调节不同特征对聚 …
卷积神经网络
dlConvolutional Neural Network(卷积神经网络,CNN)是专为网格化数据(图像、视频、语音频谱)设计的神经网络:用「卷积核 + 池化」在局部区域滑动提取特征,逐层抽象出从边缘 …
精确率
mldlPrecision(精确率)是分类任务中的关键指标:在所有「被模型预测为正类」的样本里,真正为正类的比例。它衡量模型的「查准」能力。
K
K近邻
mlK 近邻(KNN,K-Nearest Neighbors)是一种「惰性学习」分类 / 回归算法:给定一个待预测样本,在训练集中找出与其距离最近的 K 个邻居,用这 K 个邻居的标签(或平均值)作为预测 …
K均值聚类
mlK 均值(Kmeans)是最经典的「基于距离」聚类算法:先随机选 K 个点作为初始聚类中心,然后反复执行两步——①把每个样本分到距其最近的中心所在的簇;②用簇内样本的均值更新中心。直到中心不再变化或达 …
Kmeans++
mlKmeans++ 是 2007 年提出的 Kmeans 初始化改进:用「距离已有中心越远的点越有概率被选为下一个中心」的概率分布,依次选 K 个初始中心。它让 Kmeans 不再对随机初始化那么敏感, …
KD 树
dlmlKD 树(k-Dimensional Tree) 是一种用于组织 $k$ 维空间中样本点的基于特征维度划分的数据结构。 KD 树在本质上等同于二叉搜索树,区别在于其每个节点存储的是一个 $k$ 维的样 …
L
M
P
平均绝对误差
ml平均绝对误差(Mean Absolute Error, MAE) 是回归任务(即对连续值的预测)中应用最广泛且最经典的模型评估指标之一。它通过计算预测值与真实值之间差距的绝对值来刻画模型的准确性。
朴素贝叶斯
ml朴素贝叶斯(Naive Bayes)是一类基于贝叶斯定理与「特征条件独立」假设的生成式分类模型:给定类别,先估计每个特征的条件概率,再由贝叶斯公式反推样本属于每个类别的后验概率,取最大的作为预测。它在 …
批归一化
dl批归一化(BatchNorm)是 2015 年提出的深度网络训练技巧:对每个 mini-batch 内同一通道的特征做均值-方差归一化(再缩放和平移),让每层输入分布更稳定。它显著加快了收敛速度,并让 …
偏置
mldl偏置(Bias)是模型参数中的常数项:在线性组合 $z = Wx + b$ 中与权重 $W$ 相加,让激活函数可以左右平移,避免被强制经过原点。它与权重一起参与梯度更新,是几乎所有神经网络层的基本组成 …
平滑处理
mldl在机器学习和深度学习中,平滑处理(Smoothing) 是一种通过数学手段调整概率分布或模型输出,使其更加均匀、不那么“极端”的技术。
偏差与方差
mldl在机器学习和深度学习的建模过程中,偏差(Bias)与方差(Variance)是衡量模型泛化误差的两个核心指标。
Q
R
软间隔
dlml软间隔# 术语解释# 在支持向量机(SVM)中,软间隔(Soft Margin)是指在构建分类超平面时,允许部分样本点不满足严格的间隔约束条件,即容许少量样本被错误分类或落在间隔边界之内。与之相对的是 …
RMSNorm
dlRMSNorm(Root Mean Square Layer Normalization)是 LayerNorm 的简化版本:去掉均值中心化步骤,仅用激活值的均方根(RMS)做缩放。它在几乎所有任务上 …
人工神经网络
dlArtificial Neural Network(人工神经网络,ANN)是一类模仿生物神经元连接方式的计算模型:由大量「神经元」节点和带「权重」的连接构成,按层组织(输入 / 隐藏 / 输出),通过 …
S
随机森林
ml随机森林(Random Forest)是 Bagging 思想的代表实现:以决策树为基学习器,在训练时通过「自助采样」和「随机特征选择」构造多棵互不相同的树,最终预测时取所有树的投票(分类)或平均(回 …
收敛
mldl收敛(Convergence)指一个迭代过程(如梯度下降、EM 算法、贝叶斯推断)经过若干步之后,参数或目标函数值逐步逼近某个极限而不再发生显著变化的状态。在机器学习中,通常意味着损失降到接近最小值、 …
损失曲线
mldl损失曲线(Loss Curve)是把损失作为训练迭代次数(或 epoch)的函数画出的图,是判断模型是否收敛、是否过拟合、是否欠拟合的核心可视化工具。它通常包含训练损失、验证损失、测试损失三条曲线。
三维卷积
dl三维卷积(3D CNN / 3DCNN)将传统 2D 卷积扩展到时空维度:卷积核在长、宽、时间三个方向上滑动,同时提取空间特征和时间特征,广泛用于视频分类、动作识别、医学影像等时空数据建模任务。
随机梯度下降
mldl随机梯度下降(Stochastic Gradient Descent, SGD) 是梯度下降算法的一种变体,在深度学习中它是一种高效求解网络参数梯度的利器。
Sigmoid
dlmlSigmoid 函数(也称 Logistic 函数)把实数压缩到 (0, 1) 区间,常用于二分类输出层(表示概率)或门控机制(如 LSTM 中的输入 / 遗忘门)。
损失函数
dlLoss Function(损失函数)是衡量模型「预测值」与「真实值」之间差异的数学函数,是模型训练时被最小化的目标。常见有 MSE(回归)、交叉熵(分类)、Hinge Loss(SVM)等。
T
TF-IDF
mlTF-IDF(词频 - 逆文档频率)是一种给词袋模型中每个词加权的方法:词频(TF)衡量「这个词在这篇文档里有多重要」,逆文档频率(IDF)惩罚「在很多文档里都出现的常见词」,两者相乘得到综合权重。它 …
梯度消失
dl梯度消失(Gradient Vanishing)与梯度爆炸(Gradient Exploding)是深度网络训练的经典病态:反向传播时梯度沿层被反复乘以权重矩阵,指数级缩小(消失)或放大(爆炸),导致 …
凸函数
mldl凸函数(Convex Function)是指函数图像上方的区域为凸集的函数,典型形状如字母 U。它拥有「任意局部极小即全局极小」这一关键性质,是线性回归、SVM 等经典模型的理论基石。
TextRNN
dlllmTextRNN 是以 RNN 为基础用于文本分类的一类模型总称:把文本序列逐字送入 RNN,把最后一个时刻的隐藏状态作为整个句子的表示,再接全连接层做分类。常见变体包括 …
梯度爆炸
dlml梯度爆炸(Gradient Exploding)是深度网络训练中常见的数值问题:在反向传播中梯度逐层累乘,到输入层时变得极大,导致权重更新剧烈震荡甚至数值溢出。它和梯度消失是一对孪生问题,常用梯度裁剪 …
梯度提升树
ml梯度提升树(Gradient Boosting Decision Tree, GBDT)是集成学习中的经典算法:每棵新树拟合前一轮模型残差的负梯度,多棵树累加得到最终预测 …
条件概率
mldlllm条件概率(Conditional Probability) 是概率论中的核心概念,表示在已知某一事件发生的前提下,另一事件发生的可能性。
梯度下降
mldlGradient Descent(梯度下降)是一类通过「沿目标函数负梯度方向迭代更新参数」寻找最小值的优化算法,是几乎所有机器学习与深度学习模型训练的核心机制。
特征
ml在机器学习和深度学习中,特征(Feature),也常被称为属性(Attribute),是指用于描述样本特定维度的数值或信息,它是模型进行预测和计算的输入变量。
W
X
消融
dlml消融(Ablation)是一种用于评估模型中特定特征、组件或技术重要性的实验方法。
线性回归
ml线性回归(Linear Regression)是机器学习最经典的回归模型:假设自变量与因变量之间存在线性关系 y = wᵀx + b,通过训练数据学习出最优的权重向量 w 与偏置 b,使得模型预测值与 …
序列到序列模型
dlSeq2Seq(Sequence-to-Sequence)是一类把一个序列映射成另一个序列的模型结构,由「编码器(Encoder)」与「解码器(Decoder)」组成:Encoder 把输入序列压成一 …
信息熵
mldl信息熵(Information Entropy) 是由信息论之父克劳德·香农(Claude Shannon)于1948年在其论文《通信的数学原理》中提出的核心概念,用于定量地描述信息。
先验概率
ml先验概率(Prior Probability)根据历史经验推断出的概率。
小批量梯度下降
dlmlState Space(小批量梯度下降)指智能体在某给定环境中所有可能遇到的「配置 / 状况」的集合。它是强化学习、规划、游戏 AI 等领域的基础概念——智能体的目标是在小批量梯度下降中找到一条通往目 …
学习率
dlmlLearning Rate(学习率)是优化算法的核心超参数:决定每次参数更新「迈多大一步」。太大容易震荡 / 越过最优解,太小收敛过慢甚至停滞。
Y
验证损失
mldlValidation loss 是一个数字,告诉你 AI 模型在训练中学得怎么样——越低越好。研究人员把它当作实时成绩单,决定什么时候停止训练、是否调整超参数、是否要排查问题。它最重要的作用之一是帮助 …
异常值
mldl异常值是指明显偏离大多数样本的数据点,它可能来源于数据错误,也可能是真实但罕见的现象。离群值会干扰模型训练,因此通常需要识别并通过删除、截断(Clipping)或数据变换等方法进行处理。
余弦距离
dlml余弦距离(Cosine Distance) 是一种衡量两个向量在方向上差异的度量方式,广泛应用于自然语言处理(如词向量相似度计算)和检索增强生成(RAG)等领域。
有监督学习
mlSupervised Learning(监督学习)是用「已标注」的训练数据学习输入到输出映射的机器学习范式:每个样本都给出「正确答案」(标签),模型通过最小化预测与标签的差异来调整参数。
有监督微调
llmSFT(Supervised Fine-Tuning,监督微调)是用「人工编写的指令 - 回答」数据对预训练模型做监督学习,让它学会按指令行事。是 RLHF / DPO 等对齐方法的第一步。
Z
坐标上升
ml坐标上升算法(Coordinate Ascent) 是一种用于求解目标函数极大值的优化策略,其核心逻辑是在每次迭代中仅更新一个坐标(变量),而保持其他坐标固定不变
自适应提升
mlAdaBoost(Adaptive Boosting)是 Boosting 家族的奠基算法:顺序训练多个弱分类器(如浅层决策树桩),每轮训练时提高被前一轮错分样本的权重,让后续弱分类器重点关注难样本; …
正则化
mldl正则化(Regularization)是在经验风险(训练损失)之外加一个「对模型复杂度的惩罚项」的总目标函数。常见形式有 L1(Lasso)、L2(Ridge / 权重衰减)、Dropout、早停等, …
自训练
mlSelf-Training(自训练)是最简单的半监督学习算法之一:用少量标注数据先训练一个模型,然后用模型对无标注样本做预测,把「高置信度」的预测当作伪标签加入训练集,再重新训练——迭代直到收敛。它是 …
最大似然估计
ml最大似然估计(Maximum Likelihood Estimation, MLE)是概率模型最常用的参数估计方法:选择使观测数据出现概率最大的参数值作为估计量。在逻辑回归、朴素贝叶斯等模型中推导出的 …
最小二乘法
ml最小二乘法(Least Square) 是一种数学优化技术,其核心思想是通过最小化误差的平方和来寻找数据的最佳函数匹配。
召回率
mldlRecall(召回率)是分类任务中的关键指标:在所有「真实为正类」的样本里,被模型正确找出来的比例。它衡量模型的「查全」能力。