一文给你讲透机器学习中的过拟合,学完还看不懂,只能说你欠拟合
作者头像
  • 吴晶晶
  • 2020-05-11 07:28:20 3

泛化能力

机器学习的目标是通过训练样本获得的模型能够很好地应用于任何未知样本,而不仅仅是表现出色于训练样本。我们称这种模型适用于新样本的能力为泛化能力。

这与冒烟测试有些相似。冒烟测试是从所有测试用例中精心挑选出的一部分,如果冒烟测试通过了,表示自测通过,可以发布一个版本给测试人员。如果冒烟测试的用例足够多且覆盖全面,自测全部通过,那么开发发布的版本质量较高。

训练样本相当于冒烟测试中的用例。如果训练样本足够多且场景多样,我们可以认为通过学习获得的是具有强大泛化能力的模型。

过拟合与欠拟合

几乎所有人都希望经过训练样本学习得到的模型具备强大的泛化能力,但有时会适得其反。有时可能会将训练样本的特定特点误认为所有潜在样本的普遍属性,即过度关注细节,这种现象被称为过拟合。

相反,如果对训练样本的普遍属性没有充分掌握,这种现象称为欠拟合。

图像

上图中,第一张图是欠拟合的例子,第三张图是过拟合的例子,中间一张图则是恰到好处。

生活中的例子

以读书学习和欣赏美女为例来解释欠拟合和过拟合。

图像

无论在哪个阶段,班级里总有一些学生学无所成,课本上的知识都学不出来,这就是欠拟合,即知识点没有学透。

还有一些人,大家睡觉的时候,他们还在学习,甚至躲到厕所里,借助灯光拼命地学习,把课本上的内容背得滚瓜烂熟,但一到考试时,题目稍有变化就手足无措,最终成绩也不理想,这就是过拟合。

图像

观察女明星,我们会发现她们都有一个共同点:身材苗条、个子高挑、长发飘逸。我们根据这些特征建立了一个评价美女的模型。当我们看到某人的背影,发现她长发飘逸、身材苗条、个子高挑,穿着时尚,便认为她一定是美女。然而,当你满怀期待上前一看,发现她的确是个美女,但走进厕所时,却发现她竟是男厕,原来她是一个“人妖”。

这个例子中既有过拟合也有欠拟合。过拟合表现在认为长发、苗条身材和高挑个子都是美女的标志;欠拟合则体现在对性别特征的判断不足,无论是“人妖”还是普通男性,都会有明显的喉结,但你在看到美女欣喜若狂时,最终却分辨不出男女。

数学解释

损失函数用于衡量模型的一次预测效果。单次评估意义不大,因此通常评估平均意义上的预测效果,称为风险函数。风险函数分为期望风险和经验风险。期望风险是全局性的,包含已知和未知部分,无法计算。因此我们通常采用经验风险作为衡量标准。对于泛化误差,一般采用经验风险最小化,因为经验风险最小化的模型通常是最佳模型。

例如,在线性回归模型中,损失函数为平方损失函数:

图像

也称为均方误差,即求点到直线的距离。图像

分别计算点到直线的距离,可以看出最右侧的图距离最小,因为每个点都在直线上。中间的次之,最左侧的图距离最大。尽管经验风险最小化,但不一定是最优的。

图像

所求得的模型在训练数据上的误差较小,但在新样本上的误差可能很大。当泛化误差和训练误差之间的差距随样本空间数据的增加而增大,并且无法收敛时,表明发生了过拟合。如果这种差距不随容量的变化而变化,则认为该模型的泛化误差较优。

偏差(Bias)是指期望输入与真实标签之间的差异,描述了学习算法本身的拟合能力。方差(Variance)是指同样大小的训练集变动所导致的学习性能的变化,描述了数据扰动造成的影响。

图像

对于欠拟合的情况,每个点到直线的距离总和较大,意味着均方误差较大,即偏差较大,因为期望输入与真实标签之间的差异较大。由于训练不足,模型较差,因此对数据的抗干扰能力较弱,方差较小。

对于过拟合的情况,点到直线的距离很小,均方误差很小,意味着偏差很小,但对数据扰动的抵抗力差,即方差较大。

图像

左上图是最合适的模型,因此每个数据点都集中在中心。右上图是过拟合,数据点围绕中心分散。左下图是欠拟合,数据点偏离中心较远,但仍然集中。右下图是既欠拟合又过拟合,数据点分散且远离中心。

    本文来源:图灵汇
责任编辑: : 吴晶晶
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
拟合一文只能机器学习
    下一篇