机器学习对人类而言,是一场从数学世界观到计算机领域的革命!
本专栏《机器学习视角下的数学世界》致力于深入、透彻地探讨微积分、概率论和线性代数的核心概念及其相互关系,构建一个数学和数字的世界。
世界最精妙之处在于“宇宙之本”和“看法之源”。如果要用两个词来形容这两个概念,我认为是“概念”和“维度”。
从这两个词的含义来看,我们可以进行如下思考:
维度是广,概念是深
维度意味着无限扩展,包含了多样性和无穷性。一维的存在必然会引发多维现象,形成纵横交错的广度。
概念是广,维度是深
宇宙之所以广阔,是因为它包容了万物。万物可以通过概念来描述、归纳或定义。
概念是静,维度是动
概念是思想活动的起点,贯穿整个思想过程,并成为其结晶。
维度是静,概念是动
所有对象的根本是维度间的尺度关系。维度是对象的属性,而对象则是维度相互作用的结果。观念也是一种维度,观念的变化会立即引发概念的改变。
维度可以简单理解为“属性”。例如,一个人的年龄属性、桌子的材质属性、员工的体重属性等。在某些情况下,维度也可以称为“角度”,如从GDP的角度、从失业率的角度或从人口的角度来看待中国经济。还可以直接称之为“度”,如亮度、长度、硬度等。
从语言体系来看,这些概念——属性、维度、角度、度——本质上是相同的,不妨统一称为“维度”。年龄维度在社会学中被研究,失业率、GDP等维度在经济学中被研究,而亮度、温度、强度等则在物理学中被研究。
因此,如果把这些学科中属性或维度的实证研究视为“粗浅”,那么上文关于维度的深入探讨则属于哲学领域。介于哲学和具体学科之间的维度,则是量化,即数学。
在高等数学中,维度可以量化为实数,即实数轴,又称为连续维度。通过距离来度量维度内的事物,维度之间的度量则通过微积分完成。在线性代数中,维度被量化为向量中的元素,即对象的属性实例,可以是离散的、可数的,称为离散维度或可数维度,通过加减或乘法来度量。在概率论中,维度被量化为随机变量,即随机空间,通过概率、条件概率或熵来度量。
从静态角度看:
在实变函数论中,对实数数轴进行了深入分析。有理数是有规律且波动的,信息为零;无理数是无规律且不波动的,信息不为零。有理数是可数的量,无理数是物质信息单位,是连续的。
从动态角度看:
动态本质上是多维度甚至无量维度间的尺度关系。尺度依赖于静态维度的长度,即无理数。此时,实数体现为单位、概率或指数底,虚数则体现为量、概率大小、指数幂(熵)。
决策树的构造可以用样本的属性作为节点,属性的取值作为分支。根节点是所有样本中信息量最大的属性,中间节点是该节点为根的子树所包含的样本子集中信息量最大的属性,叶子节点是样本的类别值。
理解1:
根节点、中间节点和叶子节点都是当前处理的随机空间的维度。
理解2:
叶子节点是待决策的维度(数据),而根节点和中间节点是已知的维度(数据)。有了决策树,可以通过已知的维度来预测未知的维度。
理解3:
决策树将维度作为节点构成一棵树,从根节点到叶子节点的每条路径都代表了一次决策步骤。
理解4:
子节点可以理解为对父节点随机空间的分割路径(通过属性值分割,形成子节点)。
熵可以用来衡量一个随机系统的确定性。当我们试图预测或判断一件事情(如健身)是否会发生的时,其实是在尝试衡量这个事件所关联的随机系统的确定性,这里的度量就是“熵”。如果熵为零(概率为1),则事情完全确定,可以准确地判断和预测。
在健身案例中,可以将“周×维度”或“上午/下午维度”视为度量随机系统的工具。在度量时,无论顺序如何,最终结果相同。但使用度量结果较大的工具首先度量,工作量会增加。
理解1:
随机系统的“一部分不确定性”如果通过一把尺子度量后得到了确认,那么就不需要第二把尺子再次度量。
理解2:
被度量的随机系统有一个总体熵,通过尺子度量后,和尺子相关的不确定性要素转变为确定性,而不相关的不确定性要素则表现为熵。
从ID3算法的角度来看,被度量系统与尺子之间不确定性的相关程度就是“互信息”(互信息 = 熵 - 条件熵)的概念。我们应该首先使用互信息最大的尺子度量,形成“父决策节点”,然后通过父节点的属性值将样本空间分割,分别计算各分割后子空间中互信息量最大的维度作为下一级“父节点”,然后迭代继续分割计算。这就是ID3算法的核心。
综上所述,通过计算各个维度下随机系统的熵,比较这些熵的大小,熵小的作为父节点,熵大的作为子节点,不断计算,形成一个“尺子树”,即决策树。这个计算并形成“尺子树”的过程就是ID3算法。