一旦你掌握了数学的基础知识,就应该深入思考整个机器学习的过程。这个过程中有五个关键步骤。
以下的图表以较为清晰的方式解释了这些步骤。在我们重点关注最关键的环节——选择合适的算法处理数据和情况之前,花点时间仔细研究一下图表。
常见的机器学习算法可以分为几种类型:
回归算法
这是最受欢迎的机器学习算法之一。线性回归是一种监督学习算法,主要用于基于连续变量预测特定的结果。而逻辑回归则专门用于预测离散值。这两种算法(以及其他回归算法)以其高效著称,始终是最快的机器学习算法之一。
基于实例的算法
基于实例的学习方法利用具体的数据实例来预测结果。其中最著名的算法是K近邻算法(KNN)。KNN用于分类任务,通过比较数据点之间的距离,将每个点分配到与其最近的类别。
决策树算法
决策树算法将多个简单的学习器组合在一起形成一个强大的算法。这些学习器以树形结构排列,彼此之间相互分支。一个流行的决策树算法是随机森林算法。在这个算法中,每个学习器都是随机选择的,通常能够生成一个强大的预测模型。例如,在识别动物时,虽然单个特征(如眼睛颜色)可能不足以独立确定动物种类,但将所有观察结果结合起来,可以构建出更完整的图像,从而做出更准确的预测。
贝叶斯算法
不出所料,这些算法都基于贝叶斯定理,其中最常用的是朴素贝叶斯算法,常用于文本分析。例如,大多数垃圾邮件过滤器使用贝叶斯算法,通过用户的反馈数据来分类新邮件。
聚类算法
聚类算法的目标是发现元素之间的相似性,并对其进行分类。常用的聚类算法是K均值算法。在K均值算法中,分析师需要指定要形成的聚类数量(用变量k表示),然后根据物理距离将元素分组到相应的聚类中。
深度学习和神经网络算法
人工神经网络算法基于生物神经网络的结构,深度学习则是对这种网络进行优化。这类算法通常包含大量的标记数据和未标记数据,通过多个隐藏层进行处理。神经网络和深度学习有很多输入,这些输入经过多个隐藏层处理后产生输出。这些连接形成了特定的循环,模仿人类大脑处理信息和建立逻辑联系的方式。此外,随着算法的运行,隐藏层往往会变得更加精细。
其他算法
下面的图表展示了主要的机器学习算法及其分类和相互关系。
数字本身无法表达自己的含义,我们需要赋予它们意义。在要求更多数据之前,我们首先应该提升自己。——Nate Silver
一旦选择了算法并进行了训练,接下来的一个重要步骤就是可视化和解释结果。尽管这看起来不如算法编程的细节重要,但优秀的可视化却是优秀数据科学家与卓越数据科学家之间的关键区别。如果没有人能理解结果,再深刻的洞见也毫无价值。