本文约2271字,建议阅读5分钟。
本文旨在帮助读者轻松理解机器学习的核心概念,通过一些直观的图示,使复杂的机器学习算法变得易于理解。
尽管机器学习已经成为热门话题,但真正理解它的人并不多。目前网络上的许多机器学习文章往往晦涩难懂,缺乏实用价值。因此,本文作者vas3k通过简洁的语言和清晰的图表,让读者更容易掌握机器学习的精髓。本文不仅介绍了机器学习的基础知识,还提供了实际问题的解决方案,适合所有对机器学习感兴趣的人。
AI包含哪些领域?它与其他技术名词有何关系?AI领域的划分不是唯一的,有许多不同的观点。例如:
然而,深度学习并不一定只包括神经网络。例如,周志华教授提出的深度森林就是一个基于不可微组件的深度学习模型。因此,更科学的划分可能是如下图所示的花书中的划分:
如果你觉得阅读长文有些费力,这里有一张完整的机器学习技术路线图供你参考。
按照目前主流的分类,机器学习主要分为四类: - 经典机器学习 - 强化学习 - 神经网络和深度学习 - 集成方法
经典机器学习通常分为两类:监督学习和无监督学习。
在分类任务中,模型需要一个指导者(即标注数据),这样机器才能基于这些标注进行进一步的分类。无论是用户分类、文章分类、音乐分类还是电子邮件分类,都可以通过监督学习完成。在垃圾邮件过滤中,朴素贝叶斯算法被广泛应用。实际上,朴素贝叶斯被认为是应用最广泛且优雅的算法之一。
支持向量机(SVM)是最流行的经典分类方法之一,可用于对各种对象进行分类,如照片中的植物、文件等。SVM的基本思想是通过在数据点之间画出两条距离最大的线来进行分类。
回归本质上是分类的一种形式,但它预测的是数值而不是类别。例如,根据里程计算汽车价格、根据时间计算交通流量、根据公司增长预测市场需求等。当预测的事物与时间相关时,回归是一个很好的选择。
无监督学习是在90年代被提出的一种方法,它通过未知特征对目标进行分类,由机器选择最佳的方式。
聚类是一种没有预定义类别的分类方法。例如,当你不记得所有颜色时,将袜子按颜色分类。聚类算法试图通过某些特征找到相似的对象并将它们归为一类。
人们在使用抽象的概念时通常比使用具体特征更方便。例如,将所有有三角形耳朵、长鼻子和大尾巴的狗归为“牧羊犬”这一抽象概念。
在处理科技文章时,文章中通常会包含更多的科技术语,而在政治新闻中,政客的名字出现得最多。如果我们将这些具有特定特征的单词和文章组成新的特征,以保持它们之间的潜在联系,奇异值分解(SVD)是一个不错的选择。
关联规则学习包括分析购物车、自动化营销策略等。例如,顾客拿着六瓶啤酒走向收银台,在其路上是否应该放些花生?如果放了,这些顾客多久会再来买一次?如果啤酒和花生是绝配,那还有其他什么物品也可以这样搭配?
现实中,每个大型批发商都有自己的推荐系统,其中技术最先进的要数那些推荐系统。
“团结就是力量”,这句话很好地表达了机器学习中“集成方法”的基本思想。在集成方法中,我们通常会训练多个“弱模型”,期望通过组合它们形成一个强大的方法。在各种经典机器学习竞赛中,效果最好的方法大多属于集成方法,如梯度提升树、随机森林等。
集成方法的“组合方式”主要有三种:Stacking、Bagging、Boosting。
这就是Boosting以串行方式组合不同模型的范式。著名的XGBoost、LightGBM等库或算法都采用了Boosting方法。
从朴素贝叶斯到Boosting方法,经典机器学习的主要分支已经涵盖。如果读者希望系统而详细地了解这些内容,李航教授的《统计学习方法》和周志华教授的《机器学习》是两本非常好的中文教材。
本文作者通过简明易懂的语言和丰富的图示,成功地将机器学习的基本概念呈现给读者。对于对人工智能感兴趣但非专业背景的人来说,这篇文章是一份非常有价值的科普资料。如果你喜欢这种简单易懂的叙述方式,不妨去原博客上阅读更多内容。