数据迷信vs.机器学习:有什么区别?
作者头像
  • 吉永柏
  • 2020-05-06 13:10:03 2

机器学习是人工智能的一个分支,而数据科学则是处理数据清洗、准备和分析的领域。了解每种技术的工作原理及其相互作用非常重要。

机器学习(ML)和数据科学经常被一起提及,这是因为两者相辅相成。然而,了解它们如何运作及如何协同工作至关重要。

机器学习是人工智能的一个分支,它使计算机可以通过数据进行自我学习,并且在不需要人工干预的情况下运用这种学习。

Pace Harmon公司的主管JP Baritugo指出:“数据科学本质上是一个实用领域,而机器学习则是一系列工具和方法论。数据科学家利用专业技能、业务知识和工具来处理大数据,从而产生有价值的洞察,推动行动并实现有意义的业务成果。”

为什么机器学习需要数据科学

有效的机器学习需要高质量的数据科学。Baritugo表示:“企业需要数据科学家的专业知识来确保机器学习的正确使用和部署。”数据科学家确保模型接受的是经过清理和标准化的数据集,并且根据数据集和所解决的业务问题选择正确的算法。

RapidMiner公司的创始人兼总裁Ingo Mierswa认为:“数据科学不仅限于机器学习领域。数据科学在商业环境中实际应用于人工智能、机器学习和深度学习以及数据准备。其目标是从数据中获取洞察,预测未来趋势并提出行动(有时甚至是自动执行这些行动),这通常通过人工智能和机器学习工具来实现。”

从根本上说,数据科学家从多个来源收集并准备数据集,然后使用特定的方法从中提取洞察。在某些情况下,他们可能会涉足机器学习。而在其他情况下,则可能需要进行更基础的分析。ISG公司自动化和创新总监Wayne Butterfield认为:“在我看来,数据科学是对数据的操作。”

何时使用机器学习

当解决方案隐藏在大量数据中时,机器学习将成为有力的工具。Mierswa提到:“机器学习擅长处理数据,只需花费工作人员一小部分时间就能从中提取模式,并获得其他方法无法获得的见解。”

例如,机器学习(由数据科学提供支持)在金融服务中的风险分析、欺诈检测和资产组合管理、基于GPS的旅行预测,以及亚马逊和Netflix的产品和内容推荐中发挥重要作用。

Butterfield表示:“机器学习适用于已有大量标注良好历史数据或能快速模拟数据的问题。如果企业没有足够的数据来进行训练,那么使用机器学习会花费更多时间。”

密歇根理工大学计算机系统的副教授Timothy Havens说:“机器学习模型的质量取决于它们学习的数据质量。现在有许多问题包含大量的数据。”

Butterfield进一步解释道:“某些问题非常适合机器学习。例如,数据科学(不包括机器学习)多年来一直用于预测和规划,但准确性有限。由于企业现在可以构建能够考虑多个数据源的复杂算法,如天气、历史疾病模式、外部事件、过去的市场需求等,因此可以获得更精确的预测,频率也不仅限于每天一次,可能是每小时一次。”

在金融服务领域,机器学习和数据科学为保险和欺诈预防提供了强大的解决方案。在IT领域,可以改善网络管理。医疗机构可以利用机器学习和数据科学提高诊断准确率,确定最佳的价格和数量组合,或预测患者的治疗效果。在客户体验管理中,它们共同改善客户互动,预测客户生命周期价值,并预测客户流失。零售商可以利用它们来预测需求、优化定价并细分客户。在制造业中,数据科学和机器学习可用于实现供应链自动化并改进规划。

何时数据科学已经足够

围绕人工智能的各种技术应用,每个业务问题似乎都成了一个投入一些机器学习的机会。但在许多情况下,机器学习可能无法正常工作,甚至可能导致更大问题。

Everest Group副总裁Anil Vijayan表示:“有时数据科学就已经足够。由于界限模糊,很难明确区分数据科学和机器学习。最终,大多数算法都使用统计技术。并非所有问题都需要人工智能来解决。在许多情况下,使用传统数据科学不仅足够,而且效率更高。”

Vijayan还指出,传统数据科学(不需使用机器学习)在输入依赖相对较少的参数且这些参数不会随时间大幅变化的情况下更为有效。此外,当输入和参数之间的关系已被充分理解且不太可能发生改变时,仅使用数据科学就足够了。

    本文来源:图灵汇
责任编辑: : 吉永柏
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
迷信区别机器数据学习什么vs
    下一篇