【导读】机器学习将在未来扮演关键角色,因为它将在计算机和其他领域得到广泛应用。尽管如此,开发有效的机器学习应用需要大量的专业知识,而这在教科书中往往难以找到。
随着机器人技术、智能家居设备、智能零售和自动驾驶汽车技术的进步,我们正迎来一个崭新的时代。机器学习是推动这些新技术发展的核心力量。未来,自动化机器的进步有望达到甚至超越人类智能的水平。毋庸置疑,机器学习将是下一个重要的技术浪潮,而未来的许多技术都将与其紧密相连。
机器学习之所以重要,是因为它可以帮助预测人类难以预料的行为和模式。机器学习拥有无数实用的应用案例。借助机器学习,我们可以处理那些以往令人困惑的情况。了解了具备高效泛化能力的机器学习模型后,我们可以利用它来做出重要的决策。机器学习使得个人能够根据大量情境做出明智的决定。目前,我们尚无法编写适用于所有新情境的代码。
人工智能能够执行各种需要学习和判断的任务,涵盖自动驾驶汽车、投资银行、医疗保健以及招聘等多个领域。
机器学习算法能够从特定情境中概括出一般性的方法,从而更经济高效地完成任务。相比之下,手动编程则显得昂贵且低效。“可用数据”的增加必然会导致数据获取方面的问题。因此,机器学习将成为未来的核心技术,因为它将在计算机和其他领域得到广泛应用。然而,开发有效的机器学习应用仍然需要大量的专业知识。
以下是六个关于机器学习最有价值的经验教训:
机器学习的一个基本特性是算法必须从训练数据中泛化出所有不可见场景的完整范围,以便在应用模型时能够做出正确的推断。泛化过程要求我们用于训练模型的数据具有高质量和可靠性,这有助于模型理解输入与输出之间的未知和基本“真实”映射。泛化是从特定到普遍的过程。
机器学习算法是一种自动简化历史情境的技术,能够在更大规模的数据和更快的速度上实现泛化。
机器学习初学者最常见的错误是在训练数据上进行测试,然后看似取得了成功。然而,如果在新数据上尝试所得到的分类器,其表现可能并不优于随机猜测。因此,如果你想开发一个分类器,务必预留一部分数据作为测试集,并在测试数据上对其进行评估。
机器学习算法分为三个部分:表示、评估和优化。
表示: 数据需要以适合算法的方式输入。例如,对于文本分类,可以从全文中提取特征,并将其转换为“词袋”表示法。选择一种表示方法实际上等同于选择能够学习的分类器集合。这个集合被称为学习者的假设空间。
评估: 这是一个衡量我们工作进展的指标。我们需要一个评估过程来区分好的分类器和差的分类器。如果你能够对测试集进行预测,比如测试集的大小为n,你可以计算平均相对误差,甚至选择使用均方根误差。
泛化虽然是主要目标,但仅仅拥有数据并不足以解决问题。幸运的是,我们所要掌握的功能并不是从所有可计算的功能中得出的。即使是基本的假设,如平滑度、相似样本具有相似类别、不足的依赖关系或受限的复杂度,也足以使机器学习发挥作用。这使得机器学习成为一种强大的工具。
如果数据不足以完全训练一个分类器,可能会导致模型只能在训练数据上有效。这种情况被称为过拟合,被认为是机器学习中的一个难题。识别自己的模型是否过拟合是有帮助的,但这并不能解决根本问题。你需要采取措施来避免这种情况。幸运的是,有许多方法可以尝试。交叉验证有助于防止过拟合。其他方法包括增加更多数据、正则化、删除特征、提前停止和集成方法。
特征工程是指利用领域知识来开发有助于机器学习算法表现更好的特征的技术。如果处理得当,它可以显著提升算法的预测能力。这些特征可以简化整个机器学习过程。通过使用多个与类别高度相关的独立特征,可以使学习过程变得更加容易。
奥卡姆剃刀原理强调,不必要的实体不应被添加。这意味着两个分类器具有相似的训练误差时,较为简单的那个可能具有更低的测试误差。每个机器学习项目都应该以解决业务问题为目标。应该从定义主要的成功标准开始。
使用奥卡姆剃刀原理并选择最容易解释、说明、部署和管理的模型是构建强大机器学习系统的必要步骤。建议选择最简单且足够精确的模型,但同时要确保对具体问题有足够的了解,以明确“足够精确”的含义。