机器学习算法之随机森林算法粗浅易懂版本
作者头像
  • 杨伟健
  • 2020-03-19 11:02:54 6

集成学习算法两大利器

Bagging: 随机森林

Bagging是一种集成学习方法,通过多次从原始数据集中有放回地抽样(即Bootstraping)来创建多个数据子集,然后在这些子集上分别构建决策树。最终的预测结果通过多数投票的方式得出。这种方法特别适用于分类问题。

随机森林的关键点包括:

  • 样本的随机性:每次构建决策树时,只使用一部分有放回抽取的样本。
  • 特征的随机性:在构建每棵树时,随机选择一部分特征进行分裂。

在生成足够数量的决策树后,对于分类任务,采用多数投票的方法;对于回归任务,则采用所有树的预测值的平均值。

随机森林的优势分析

  • 分类强度:单棵决策树的分类能力越强,随机森林的整体性能就越好。
  • 树间相关度:树之间相关性越低,随机森林的效果越好。
  • 袋外数据(OOB)误差:OOB误差是指那些未被选入特定子集的样本,它们可以用来评估模型的泛化能力。这种方法无需额外的测试集,从而节省了资源。

袋外数据误差计算的具体步骤如下:

  1. 对于每一个已经生成的随机森林模型,使用袋外数据作为输入。
  2. 将袋外数据输入到随机森林分类器中,得到分类结果。
  3. 将分类结果与实际标签进行比较,统计分类错误的数量。
  4. 袋外数据误差等于分类错误的数量除以总袋外数据量。

这种方法已被证明是一个无偏估计,因此不需要额外的交叉验证或独立的测试集来估计模型的误差。

    本文来源:图灵汇
责任编辑: : 杨伟健
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
算法粗浅易懂随机机器森林版本学习
    下一篇