8个运用案例告诉你,机器学习都能做什么?
作者头像
  • 胡蓉
  • 2020-03-22 13:24:00 0

导读

本文将介绍两种主要的预测任务:回归和分类。这两种任务适用于许多场景和数据类型。此外,精心设计的特征对于回归和分类方案的成功至关重要。

本文通过八个案例展示机器学习的应用场景。

01 回归

假设我们想预测一家即将上市的公司的股价。根据相关流程,首先需要收集一些已知股票价格的公司数据(最好是来自同一领域的公司)。接着,需要设计与当前任务相关的特征。

例如,公司的收入可以作为一个潜在特征,因为通常认为收入越高,股票价格也越高。其他可能的特征包括总资产、总股本、员工数量和年度活跃度等。为了将股票价格与收入联系起来,我们可以使用训练数据来训练一个线性模型或回归线。

图1-7展示了由10家公司的股价和收入数据构成的小型训练集,以及一个拟合这些数据的线性模型。一旦模型训练完成,就可以根据公司的收入预测其股价。

最后,将预测的价格与测试集中的实际价格进行比较,以评估回归模型的效果,并根据需要进行调整。通过一组训练数据来预测连续变量(如股票价格)的任务被称为回归。

示例1:美国学生贷款债务增长

图1-8显示了从2006年至2014年美国公民持有的学生贷款债务总额,每季度评估一次。学生贷款主要用于支付大学学费和生活费用。

数据显示,在这八年期间,学生贷款债务增加了两倍,到2014年底达到了超过1万亿美元。拟合数据的趋势线很好地反映了数据,其陡峭的正斜率表明学生贷款债务正在迅速增长。如果这种趋势持续下去,到2026年底,学生贷款债务总额可能会达到2万亿美元。

示例2:收入预测

1983年,奥斯卡最佳编剧William Goldman在其著作《Adventures in the Screen Trade》中提到,“没有人知道任何事情”,这意味着在当时很难预测好莱坞电影是否成功。然而,在互联网时代,准确估计即将上映电影的票房收入已成为可能。

特别是,预告片的网络搜索量以及Twitter、Facebook等社交媒体上关于电影的讨论数量,可以提前一个月可靠地预测电影的首映周末票房收入。一些产品的销量预测,包括电影票房预测,通常使用回归方法完成。其中,输入特征可以是某一天的预告片搜索量,输出则是相应时间段内的票房收入。基于这些数据学习的回归模型可用于估计新电影的预期收入。

示例3:基因与数量性状的关联

全基因组关联研究(GWAS)旨在了解数千个基因标记之间的关系,这些基因标记来自不同领域的人类基因组,涵盖高血压、胆固醇、心脏病、糖尿病等多种疾病。

这些研究希望有一天能产生基因靶向疗法,帮助治愈由多种因素引起的疾病。在GWAS研究中,回归作为一种常用工具,用于了解基因标记(特征)与胆固醇或血糖水平(连续输出变量)等数量性状之间的复杂关系。

02 分类

分类任务与回归任务在原理上相似,主要区别在于分类任务的目标是预测离散的值或类别,而不是预测连续值输出(如股票价格和血压等)。分类问题可以通过多种方式呈现。例如,目标识别是一种非常流行的分类任务,它涉及将一组图像中的目标区分开来(如自动分类邮件上的手写数字,或在半自动驾驶和自动驾驶过程中识别路标)。

在《如何教计算机区分猫和狗》一文中讨论的小型任务也是此类分类任务。其他常见的分类任务包括语音识别(识别不同的口语单词)、在社交媒体上确定对某个产品或服务的总体情绪,以及在有限的可能集合中确定一个人正在进行的手势(如控制一台没有鼠标的计算机)。

从几何学角度来看,一种常见的处理分类任务的方法是找到一个分割线(或更高维度的超平面),尽可能将两类数据从训练集中分离出来。

示例4:目标检测

目标检测是一种常见的分类任务,涉及在一组图像或视频中自动识别特定对象。典型的应用包括人脸检测(用于组织焦点和对焦相机)、行人检测(用于自动驾驶汽车)和产品检测(用于电子制造业的质量控制)。

在人脸检测的例子中,通过在图像上滑动一个小窗口来寻找人脸。在每个位置,测试窗口中的内容是否属于人脸。如果内容位于分类器的“人脸”一侧,则将其分类为人脸。

示例5:情感分析

社交媒体的兴起使消费者的声音更加响亮,提供了多种渠道来反馈、讨论和评价产品和服务。这促使许多公司寻找数据密集型方法来评估消费者对新产品、广告活动等的感受。

通过分析产品评论、推文和回复等文本内容,通常可以确定大量客户群体的总体情绪,这被称为情感分析。分类模型通常用于情感分析,以辨别消费者的正面或负面情绪。

示例6:分类作为医学诊断工具

各种癌症仍然是诊断和治疗中最具挑战性的疾病之一。现代医学认为,许多癌症是由基因突变积累引起的,即个人DNA序列的错误复制。通过DNA微阵列技术,遗传学家可以同时查询健康和肿瘤组织中成千上万个基因的表达水平。这些数据可以用于自动识别癌症易感患者的分类框架。

在医学领域,功能性核磁共振成像(fMRI)越来越多地用于诊断神经系统疾病,如自闭症和注意缺陷多动障碍(ADHD)。这些扫描可以在患者执行简单的认知任务时捕捉大脑不同区域的神经活动模式。

最终目标是训练一种诊断分类工具,仅基于fMRI扫描就能区分患有特定神经系统疾病的患者和没有此疾病的患者。

03 特征设计

正如我们在后续章节中所描述的,特征是定义给定数据集的特性,从而使学习过程达到最优。理想情况下,精心设计的特征对于回归和分类方案的成功至关重要。

但是,从广义上说,我们所设计的特征的好坏,从根本上取决于我们对所研究现象的理解程度。我们对现象的了解越深入,设计的特征就越有效,或者在理想情况下,教会计算机自己完成这项设计工作。在极端情况下,我们几乎完全了解数据的生成过程,这些知识来自于大量的直观、实验和数学思考,我们设计的特征也会有近乎完美的效果。

但在大多数情况下,我们对正在分析的数据了解得很少,甚至完全不了解。宇宙的复杂性和我们的认识仍然有限。

以下是一些例子,说明我们对现象的理解程度(从非常深入到只有一些基本原理)如何指导特征设计。本节的一个目的是具体阐述机器学习技术处理这一问题的现状。

机器学习的一个最终目标是开发有效的工具来处理任意类型的数据(发现其中的模式)。这一目标目前尚未充分实现,从根本上来说,它涉及寻找合适的特征。

示例7:伽利略和匀加速

1638年,伽利略因为在《关于两种新科学的对话》一书中大胆宣称地球绕太阳旋转而被天主教会驱逐。在这本书中,他通过亚里士多德式的对话方式,为匀加速运动的概念提供了实验和哲学证据。

具体来说,伽利略(和他的同行)直觉地认为,由于重力的作用,物体的加速度在时间上是恒定的。换句话说,物体下落的距离与其运动时间的平方成正比。这一关系是伽利略通过一个巧妙而简单的实验经验性地得出的。

如图1-12所示,伽利略反复让一个金属球从一个倾斜的木板上滚下,并记录小球到达木板斜面1/4、1/2、2/3、3/4和底部的时间。

注:这里使用斜面而非直接垂直投掷的原因是,在伽利略的时代,计时器不够精确,无法准确测量球的下落时间。

通过现代实验重现(30次实验的平均值)得到了一些数据,如图1-13所示。但是,这里没有显示原始的时间和距离数据,而是显示了时间和对应的特征,即时间的平方。在伽利略的原始实验中,时间是用水的毫升数估计的。

通过将时间的平方作为特征,数据集变得非常线性,可以近乎完美地用线性回归拟合。

示例8:视觉目标检测的特征设计

一个更现代的特征设计示例是视觉目标检测任务。在这个任务中,我们对数据生成的底层过程只有部分了解。与之前讨论的伽利略和匀加速的例子不同,我们对视觉认知的基本过程知之甚少。然而,即使在这种一知半解的情况下,也可以为目标检测设计出有用的特征。

在视觉分类任务的特征设计过程中,一个最重要的理念是,自然图像中的辨别信息很大程度上集中在图像内部相对较少的边缘中。自然图像中的人物可能置身于森林、户外场景、城市景观、人群、动物和建筑物等环境中。

图1-14中的例子包括一张自然图像及其边缘检测版本。自然图像中的大部分像素不属于任何边缘,但在只有边缘的情况下,我们仍然可以识别图像中的内容。

通过在青蛙、猫和灵长类动物身上进行的大量视觉研究(通过视觉刺激并记录处理视觉信息的大脑区域的电脉冲),神经科学家已经确定,单个神经元大致通过识别边缘来发挥作用。

因此,每个神经元都可以被视为一个小的“边缘检测器”,定位图像中特定方向和宽度的边缘,如图1-15所示。一般认为,通过组合和处理这些边缘检测图像,人类和其他哺乳动物就能“看到”。

关于作者

杰瑞米·瓦特(Jeremy Watt)拥有美国东南大学计算机科学与电气工程博士学位,研究兴趣包括机器学习、计算机视觉和数值优化。

雷萨·博哈尼(Reza Borhani)拥有美国东南大学计算机科学与电气工程博士学位,研究兴趣包括面向机器学习和计算机视觉问题的算法设计与分析。

阿格洛斯·K.卡萨格罗斯(Aggelos K. Katsaggelos)是美国东南大学计算机科学与电气工程系教授,Joseph Cummings荣誉教授,图像与视频处理实验室主任。

    本文来源:图灵汇
责任编辑: : 胡蓉
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
运用机器告诉案例学习什么
    下一篇