以通用的监督学习为例,基本包括以下四个部分:
在机器学习算法中,偏向是由先验假设不合理引起的模型误差,高偏向会导致欠拟合。欠拟合指的是模型未能充分学习到特征和标签之间的因果关系,从而无法有效掌握历史数据。另一方面,方差表示模型对样本变化的敏感程度,高方差会导致过拟合。过拟合意味着模型过度学习了训练数据中的随机噪声,导致在新数据上的表现不佳。机器学习模型的关键在于其泛化能力,即在未知数据上的表现如何。
假设我们有一个预测模型: 我们希望通过 ( f^e(x) ) 来估计 ( f(x) )。如果使用基于平方损失的线性回归,那么误差分析如下: 因此,可以清楚地看到模型的学习过程实际上是对偏向和方差的权衡。
标准线性回归通过线性组合自变量来预测因变量,通过最小化训练集内所有样本的预测平方误差和来确定自变量的权重。具体来说:
所有的机器学习模型都有一定的先验假设,线性回归也不例外。它假设:
最小二乘法与上述假设之间的关系如下: 利用最大似然估计(MLE)可以估计参数: 线性回归有两个重要的变体:
关于正则化和最优化的内容将在后续介绍。
更多详细信息可参考:最小二乘法