集成学习算法两大利器
Bagging: 随机森林
Bagging是一种集成学习方法,通过多次从原始数据集中有放回地抽样(即Bootstraping)来创建多个数据子集,然后在这些子集上分别构建决策树。最终的预测结果通过多数投票的方式得出。这种方法特别适用于分类问题。
随机森林的关键点包括:
- 样本的随机性:每次构建决策树时,只使用一部分有放回抽取的样本。
- 特征的随机性:在构建每棵树时,随机选择一部分特征进行分裂。
在生成足够数量的决策树后,对于分类任务,采用多数投票的方法;对于回归任务,则采用所有树的预测值的平均值。
随机森林的优势分析
- 分类强度:单棵决策树的分类能力越强,随机森林的整体性能就越好。
- 树间相关度:树之间相关性越低,随机森林的效果越好。
- 袋外数据(OOB)误差:OOB误差是指那些未被选入特定子集的样本,它们可以用来评估模型的泛化能力。这种方法无需额外的测试集,从而节省了资源。
袋外数据误差计算的具体步骤如下:
- 对于每一个已经生成的随机森林模型,使用袋外数据作为输入。
- 将袋外数据输入到随机森林分类器中,得到分类结果。
- 将分类结果与实际标签进行比较,统计分类错误的数量。
- 袋外数据误差等于分类错误的数量除以总袋外数据量。
这种方法已被证明是一个无偏估计,因此不需要额外的交叉验证或独立的测试集来估计模型的误差。