一文读懂机器学习中经典的算法模型:决策树
作者头像
  • 2020-03-19 17:32:29 2

决策树不仅可以用于分类,还可以用于回归分析。

通过ID3(基于信息增益)、C4.5(基于信息增益率)和CART(基于基尼系数)算法,可以创建分类决策树。而在CART中,使用方差作为指标创建回归树。

决策树是一种树状结构,每个非叶节点代表一个基于样本特征的判断条件,满足条件的样本进入左子树,不满足的进入右子树。决策树可以类比于二叉树,但每个非叶节点的判断条件更加多样。

决策树示例

假设我们有五个样本,每个样本有两个特征:年龄和性别。我们想要构建一个决策树,来判断这些人是否喜欢踢足球。判断条件是“年龄小于15岁的男性”。这样,我们得到了一个简单的决策树,根据年龄和性别来进行决策。这个例子展示了决策树在分类任务中的有效性。

决策树不仅用于分类,还可以表示给定特征条件下类的条件概率分布。例如,在一个划分好的特征空间中,每个单元格代表一个特定的条件概率分布。决策树的每条路径对应于一个特定的单元格,从而决定了最终的分类结果。

熵的概念

熵是用来衡量系统的混乱程度。当一个系统内部的类别越多,熵值越大。熵越小,表示系统越有序。熵的计算公式为:[H(X)=-sum{i=1}^{n} pi log2 pi],其中 (p_i) 表示第i个类别的概率。

熵的应用

熵常用于评估决策树的分裂效果。例如,一个节点的熵值为0,表示该节点的所有样本属于同一类别。信息增益是通过分裂前后熵值的变化来衡量分裂效果的一种方式。信息增益率则是在信息增益的基础上引入了特征本身的熵值,以避免偏向取值较多的特征。

基尼系数

基尼系数也是一种衡量数据集纯度的方法,计算公式为:[Gini(p)=sum{i=1}^{n} pi (1-pi)],其中 (pi) 表示第i个类别的概率。基尼系数越小,表示数据集的纯度越高。与熵类似,基尼系数越小,表示决策树的分类效果越好。

决策树的构建

决策树的构建过程是从根节点开始,递归地选择最佳分裂特征和分裂点。在CART算法中,分裂的标准是基尼系数最小化;而在ID3和C4.5中,分裂的标准是信息增益或信息增益率最大化。对于连续特征,需要通过二分法找到最优的切分点。

决策树的剪枝

为了避免过拟合,决策树的剪枝是必要的。预剪枝是在构建过程中提前停止分裂,而后剪枝则是先构建完整的树,再从底部向上逐步剪枝。剪枝的目标是找到既能保证较高分类准确率,又不过度复杂化的决策树。

回归树

回归树的构建与分类树类似,但使用的是均方误差作为分裂标准。每个叶节点的输出值是对应区域内所有样本目标值的平均值。

多变量决策树

多变量决策树允许使用多个特征的线性组合进行分裂,从而实现更复杂的分类边界。这种方法提高了模型的灵活性和表达能力,但同时也增加了计算复杂度。

通过这些方法,决策树可以在多种场景下提供强大的分类和回归能力。

    本文来源:图灵汇
责任编辑: :
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
一文算法模型决策机器经典学习
    下一篇