机器学习从零末尾系列连载——线性回归
作者头像
  • 智能明道
  • 2020-03-11 11:20:49 4

以通用的监督学习为例,基本包括以下四个部分:

偏向与方差

在机器学习算法中,偏向是由先验假设不合理引起的模型误差,高偏向会导致欠拟合。欠拟合指的是模型未能充分学习到特征和标签之间的因果关系,从而无法有效掌握历史数据。另一方面,方差表示模型对样本变化的敏感程度,高方差会导致过拟合。过拟合意味着模型过度学习了训练数据中的随机噪声,导致在新数据上的表现不佳。机器学习模型的关键在于其泛化能力,即在未知数据上的表现如何。

对方差和偏向的一种直观解释

假设我们有一个预测模型: 我们希望通过 ( f^e(x) ) 来估计 ( f(x) )。如果使用基于平方损失的线性回归,那么误差分析如下: 因此,可以清楚地看到模型的学习过程实际上是对偏向和方差的权衡。

模型原理

标准线性回归通过线性组合自变量来预测因变量,通过最小化训练集内所有样本的预测平方误差和来确定自变量的权重。具体来说:

  • 预测函数:线性回归通过线性组合自变量来预测因变量。
  • 参数学习:采用最小二乘法来确定权重。

所有的机器学习模型都有一定的先验假设,线性回归也不例外。它假设:

  • 自变量之间相互独立,不存在多重共线性。
  • 因变量是自变量的线性加权组合。
  • 所有样本独立同分布,并且误差项服从特定的分布。

最小二乘法与上述假设之间的关系如下: 利用最大似然估计(MLE)可以估计参数: 线性回归有两个重要的变体:

  • Lasso回归:使用L1正则化并通过最大后验概率(MAP)估计参数。
  • Ridge回归:使用L2正则化并通过最大后验概率(MAP)估计参数。

关于正则化和最优化的内容将在后续介绍。

损失函数

更多详细信息可参考:最小二乘法

    本文来源:图灵汇
责任编辑: : 智能明道
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
末尾线性回归机器连载系列学习
    下一篇