为什么机器学习项目非常难管理?
作者头像
  • 科技亮点
  • 2020-04-18 09:31:02 5

导读

我见过很多公司在尝试应用机器学习的过程中,有的取得了巨大的成功,有的则遭遇了失败。一个普遍的问题是,机器学习团队往往难以明确目标和期望。为什么会这样?

1. 预判难度与实际难度存在差距

国际象棋中击败卡斯帕罗夫看似艰巨,但实际上,计算机早在二十多年前就做到了这一点。然而,精确地抓取和移动物体依然是一个尚未解决的研究难题。人类常常难以准确评估哪些任务对AI来说是困难的,哪些又是简单的。例如,在情绪预测方面,影评的情绪识别准确率可以高达90%-95%,而在推特上,针对航空公司推文的情绪预测准确率甚至能达到95%以上。然而,在某些情况下,准确率却可能停滞在65%至68%之间,这表明数据本身对最先进的机器学习技术存在一定的限制。

2. 机器学习容易出现意外的失败

机器学习通常在拥有大量训练数据的情况下表现出色,但一旦遇到与训练数据不同的情况,其性能可能会大幅下降。例如,一个基于网上图像训练的机器人在实际环境中识别物体的能力远不如预期。此外,随着时间的推移,数据分布的变化也会导致模型性能下降。例如,从2017年开始训练的模型在2018年的表现就可能不尽如人意。这些变化可能导致模型完全失效,尤其是在对抗性环境下。

3. 训练数据的获取和标注需要大量投入

机器学习的成功很大程度上依赖于大量的相关训练数据。然而,数据收集和标注是一项既昂贵又耗时的任务。对于某些应用场景,数据可以是业务流程的副产品,但对于许多其他场景而言,数据收集和标注的成本非常高。例如,在医疗领域,尽管机器学习似乎非常适合处理各种信号和清晰的结果,但由于隐私问题,数据往往难以获取或统一收集。

如何解决这些问题?

1. 关注训练数据

仔细分析模型对训练数据的错误分类情况。这些错误往往是由于标注错误或边界样本造成的。每个人都应该查看训练数据并自己标注一部分数据,因为一个模型的性能通常不会超过两个独立人员的平均效果。

2. 逐步推进

从最简单、最有效的事情开始,然后逐步增加复杂性。部署一个基本版本,从中学习,然后再进行改进。这有助于尽早发现问题,并且可以让你重新评估需要收集的训练数据类型。

3. 应对不可避免的失败

几乎所有机器学习模型在长时间运行中都会出现错误,如何应对这些错误至关重要。模型通常会提供一个可靠的置信度评分。通过批量处理,可以建立一个包含人工干预的循环系统,将低置信度的预测发送给人类操作员,以确保系统可靠地运行并收集高质量的训练数据。对于其他应用场景,可以采用标记潜在错误或以更友好的方式显示低置信度预测的方法。

结语

机器学习项目面临的挑战是多方面的,包括对任务难度的预判、数据分布的变化和训练数据的收集。通过关注训练数据、逐步推进和应对失败,可以更好地管理和优化机器学习项目。

    本文来源:图灵汇
责任编辑: : 科技亮点
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
机器非常为什么项目学习管理
    下一篇