机器学习:概述
作者头像
  • 贺晴明
  • 2020-03-06 16:11:29 1

机器学习是人工智能的一个重要分支,主要研究如何利用数据模型来获取知识。这种知识通常是不确定性的,需要通过数据挖掘来揭示潜在规律,因此构建的模型多为统计意义上的模型,用来模拟实际情况,所以也被称为统计学习。

机器学习大致可分为两类:监督学习和非监督学习。监督学习指的是训练数据集包含明确的结果,即提供数据及其相应的标签;而非监督学习则是提供一组数据,让模型自行发现其中的规律。此外,还有一种强化学习,它不需要预先设定任何数据,而是通过接收环境对行为的反馈来学习,并不断调整模型参数,形成一个输入与反馈的循环系统。

常用的监督学习模型包括:感知机、K近邻、朴素贝叶斯、决策树、逻辑回归、最大熵模型、支持向量机、提升法、EM算法、隐马尔可夫模型、条件随机场等;非监督学习模型则有:聚类、奇异值分解、主成分分析、潜在语义分析、马尔可夫链蒙特卡洛方法等。

理解这些模型需要一个统一的框架,即模型、策略和算法。模型是指如何用数学公式描述问题,策略是指选择合适的方法(如蛮力法、分治法、贪心算法等),算法则是具体实现策略的步骤。例如,在感知机模型中,模型使用一个符号函数来分类,策略通过损失函数寻找最优参数,算法采用梯度下降法来逼近解。

在机器学习中,模型的效果通常通过训练误差和测试误差来评估。理想情况下,这两个误差都应该很小,但实际操作中很难同时满足。有时模型在训练集上表现良好,但在测试集上却表现不佳,这种情况称为过拟合。过拟合的原因往往是模型过于复杂,导致简单的问题变得复杂化。解决这一问题的一种常见方法是在模型中加入正则化项,以控制模型的复杂度,通常这个项与问题的结构有关。

在监督学习中,所建立的模型可以分为生成模型和判别模型。生成模型是从联合概率分布出发,求解条件概率分布,即已知P(X,Y)求P(Y|X);而判别模型则是直接从数据中学习条件概率分布P(Y|X)。上述的监督学习方法可以根据其使用的模型类型大致归为这两类。

    本文来源:图灵汇
责任编辑: : 贺晴明
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
概述机器学习
    下一篇