小白也看得懂的机器学习模型工作原理
作者头像
  • 陈丽慧
  • 2020-05-05 15:26:50 6

很多面试官喜欢问这样一个问题:“假设我是个五岁的孩子,请向我解释某个技术。”这个问题看似简单,但实际上要求尽可能清晰地解释一项技术。本文将尝试实现这一点,解释什么是机器学习及其不同类型,同时介绍一些常见的模型。

对于那些没有或几乎没有数据科学背景的人来说,这篇文章应该很容易理解(如果觉得难懂,请随时反馈)。

机器学习的定义

机器学习指的是将大量数据加载到计算机程序中,并选择一种模型来拟合数据,从而使计算机能够在不需要人工干预的情况下做出预测。这个过程依赖于算法,这些算法既可以是简单的方程式(如直线方程),也可以是复杂的逻辑或数学系统,最终目的是让计算机能够得出最佳预测。

简而言之,机器学习就是让计算机通过模型学习数据中的模式,然后根据新的输入条件做出预测。

有监督机器学习的定义

有监督学习是一种机器学习方法,在这种方法中,用于训练的数据是带有标签的。标签意味着数据行的结果是已知的。例如,如果你的模型正在预测朋友是否会打高尔夫球,那么数据行会包含温度、星期几等变量,同时也会有相应的标签,表示朋友是否打了高尔夫球。

无监督机器学习的定义

与有监督学习相反,无监督学习的数据没有标签。在这种情况下,计算机需要自己找出数据中的模式,以预测未来会发生什么。

有监督机器学习模型

逻辑回归

逻辑回归适用于分类问题,即目标变量(需要预测的变量)分为不同的类别。这些类别可以是“是/否”,也可以是连续变量。逻辑回归模型通过创建包含数据的曲线来预测新观测值的结果。

线性回归

线性回归是最早的机器学习模型之一,因为它的算法相对简单,易于理解。线性回归用于连续变量的预测,例如房屋价格。线性回归模型通过计算每个变量的系数来预测新数据点的结果。

K近邻算法(KNN)

K近邻算法可以用于分类或回归任务。该算法首先绘制所有数据点,并选择K个最近的数据点来预测新数据点的目标变量值。K值的选择会影响预测的准确性。

支持向量机

支持向量机通过在数据点之间建立边界来运行,这些边界将不同类别的数据点分开。支持向量机寻找具有最大边距的边界,以此来进行分类。

决策树和随机森林

决策树和随机森林模型已经在之前的文章中详细解释过,可以通过链接查看。

无监督机器学习模型

K均值聚类

K均值聚类是一种常用的无监督学习方法,用于将数据点分组。首先需要假设数据集中有K个聚类,然后通过迭代过程将数据点分配到最近的聚类中心,并更新聚类中心的位置。

DBSCAN聚类

DBSCAN聚类模型不需要预先设定聚类数量,而是通过查找数据点周围的密度来自动识别聚类。这种模型能够识别任意形状的聚类,同时也能识别噪声点。

神经网络

神经网络是一种模拟人脑神经元工作方式的模型,可以处理复杂的数据类型,如图像和音频。神经网络能够识别数据中的模式,甚至是一些人类可能无法察觉的模式。

希望本文能够帮助你更好地理解这些模型,并认识到它们的强大之处。如果你有任何疑问或建议,欢迎留言交流!

    本文来源:图灵汇
责任编辑: : 陈丽慧
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
小白模型原理机器学习工作
    下一篇