本文介绍了数据、分析、商业智能、报表、大数据、数据迷信、边缘分析、信息学以及人工智能和认知计算等基本概念。
数据几乎渗透到我们生活的各个方面,从手机里的数字足迹到健康记录,再到购物历史和能源使用情况。在这个数字化时代,尽管不依赖数字生活并非完全不可行,但这需要极大的牺牲精神和毅力。
我们不仅是数据的创造者,也是活跃的数据使用者。例如,我们经常检查自己的在线消费习惯、监测健身应用程序,或查看旅行积分是否足够兑换加勒比海的假期。这些行为都在生成数据。
数据本质上是存储起来以备将来使用的各种信息。最早的信息记录方式可能是刻在动物骨头上的符号。到了20世纪50年代,人们开始使用磁带记录数字信息,随后是穿孔卡片,再后来是磁盘。现代数据处理技术虽然起步较晚,但已经奠定了我们如何收集、存储、管理和使用信息的基础。
直到最近,我们对无法计算的信息(如视频和图像)仍然只能进行分类处理。然而,近年来,由于技术的显著进步,无法存储的数据类型越来越少。实际上,存储的信息或数据是以一种可用的编码方式建立的,旨在服务于我们的计算目的,反映了现实世界的模型。
数据是现实世界事件的连续记录或模型,这是分析学的一个关键特征。被誉为“20世纪最伟大的统计学家之一”的乔治·鲍克斯(George Box)曾说:“所有的模型都是错误的,但有些模型是有用的。”
很多时候,我们在数据中发现了一些毫无意义或完全错误的内容。记住,数据是从真实的物理世界转换而来,代表真实世界的现象。就像机械速度计是测量速度的标准工具(也是衡量速度的一个很好的替代品),这个模型实际上是测量轮胎转速,而非速度本身。
总的来说,数据是存储的信息,是所有分析的基础。例如,在可视化分析中,我们利用可视化技术和交互界面解析数据,寻找数据内部的规律。
分析(analytics)是商业中最常用但也最难理解的术语之一。对于一些人来说,分析是一种“把数据屈打成招”(找出数据中隐藏的规律)的技术或技巧,或是商业智能和数据仓库的延伸;而对另一些人来说,分析则是用于开发模型的统计、数学或定量方法。
Merriam-Webster词典将分析定义为“一种逻辑分析的方法”。Dictionary.com则定义分析为“逻辑分析的科学”。不幸的是,这两种定义都直接使用了分析这个词的词根,似乎存在循环解释的问题。
分析这个词的起源可以追溯到16世纪80年代的中世纪拉丁语(anal-yticus)和希腊语(anal-ytiks),意思是“分解”或“放松”。我将分析定义为一种处理数据驱动问题的结构化方法:通过仔细研究现实(数据),帮助我们解决问题的一系列方法。
关于分析的定义有很多争议。对于本节讨论的问题,我将分析定义为:
一种全面的、基于数据驱动的问题解决策略和方法。
我特意避免将分析定义为某个“过程”、某种“科学”或“学科”。相反,我将其定义为一种全面的策略,正如读者将在本书第二部分中看到的,它包含过程、规则、可交付成果的最佳实践。
分析通过使用逻辑、归纳推理、演绎推理、批判性思维、定量方法(结合数据)等手段,检验和分析现象,从而确定其本质特征。分析植根于科学方法,包括问题识别和理解、理论生成、假设检验和结果沟通。
归纳推理: 当累积的证据被用来支持一个结论,但结论仍带有一些不确定性时,就会使用归纳推理方法。也就是说,最终的结论有可能(有一定概率)与给定的前提不符。通过归纳推理,我们可以基于具体的观察或数据做出广泛的、一般性的概括和总结。
演绎推理: 演绎推理基于某些普遍案例提出结论,然后依赖数据,通过统计推断或实验方法来验证或反驳提出的结论。例如,按照演绎推理方法,我们提出一个关于世界运动方式的基本理论,然后(通过数据)检验我们提出的假设的正确性。
分析可用于解决各种问题。例如,UPS公司通过分析结果优化货物运输措施,节省了150多万加仑的燃油,减少了14000吨的二氧化碳排放量;克利夫兰诊所利用分析结果优化了手术室的时间安排。
分析的成功案例使“分析”一词对技术供应商(硬件和软件)以及其他支持者具有吸引力。当然,“分析”这个词目前存在过度使用的情况,可以从人们将该术语与其他词的各种组合中看出。诸如:
虽然这些组合和搭配在分析的应用类型和描述上具有独特性,但它们常常造成理解上的混乱,尤其是对企业高管(如CXO级别的高管)而言,技术供应商总是在提供最新的分析解决方案,试图解决他们的每一个业务痛点。
我的观点(许多志同道合、理性思考的人也有相同的观点)是,分析不是一种技术,技术只是在分析活动中起到推动和赋能作用的策略和方法。
分析通常指的是可以识别数据之间具有业务意义的形式和关系的任何解决方案。分析被用于解析不同规模、不同复杂程度、结构化和非结构化、定量或定性的数据,以实现对特定问题的理解、预测或优化的具体目标。
高级分析也是分析的一个子集,它使用复杂的分析技术来支持基于模型的决策过程,这种分析通常以自动化或半自动化的方式进行。
高级分析通常包括数据挖掘、计量经济学建模、预测、优化、预测建模、模拟、统计和文本挖掘等技术。
关于分析与商业智能的区别,几乎没有达成共识。有些人将分析归类为商业智能的一个子集,而另一些人则认为它们是完全不同的类别。我将商业智能(BI)定义为:
一种管理策略,用于建立一种更具结构性和有效性的决策方法……商业智能包括报表、查询、联机分析处理(OLAP)、仪表板、记分卡甚至分析等常见要素。综合术语商业智能也可指获取、清理、集成和存储数据的过程。
有些人会将分析和商业智能的区别归纳为两个方面: 1. 所使用的量化方法(即算法、数学、统计)的复杂度; 2. 产生的结果是对历史已发生的还是未来将发生的。
也就是说,商业智能的重点是运用相对简单的数学方法展示和呈现历史数据,而分析则被认为采用更复杂的计算逻辑,并能预测特定问题、识别因果关系、确定最优解决方案,有时也被用于指示需要采取的行动和措施。
大多数商业智能的局限性并不在于技术限制,而在于分析深度和提供洞察力的能力。例如,告诉我已经发生的事情并不能帮助我决定如何采取行动以改变未来,这种结果通常是通过离线分析得出的。
分析的真正责任是形成可操作的、可执行的洞察力,从而帮助我们了解已经发生的事情(在哪里发生、为什么发生、在什么条件下发生),预测未来可能发生的事情,以及我们可以做什么来影响和优化未来的结局。
请注意,图1-1中的BI仪表板描绘了过去的现实,如销售、呼叫量、产品和账户,使你很容易获得组织当前销售状况或活动状态的快照。
大数据(big data)是一种描述难以处理的信息的方法,在将数据转化为洞察力的过程中,组织必须处理这些信息。1997年,Michael Cox和David Ellsworth首次使用了大数据这一表述,他们当时提到的“问题”如下:
可视化为计算机系统提供了一个有趣的挑战:数据集通常非常大,占用了大量的主内存、本地磁盘甚至远程磁盘的容量。我们称之为大数据问题。当数据集大到无法存储在主内存(核心存储器)中,甚至无法存储在本地磁盘上时,最常见的解决方案是扩大并获取更多资源。
将大数据视为一个概念,它突出了这样一个挑战:数据的规模和复杂性超出了传统数据分析方法可以处理的范围。我们将大数据与传统的“小”数据进行比较,包括其容量(我们拥有多少数据)、速度(生成和获取数据的速度)和多样性(包括数字、文本、图像、视频等多种数据形态)。
如果大数据是用来描述当今信息复杂性的概念,那么分析可以帮助我们以自动化的方式(预测性和规范性)来分析复杂性,而不是以被动的方式(即商业智能的范畴)来应对。
与大数据相比,定义数据迷信不是一件容易的事,因为数据迷信的定义多种多样,很少有共识。关于数据迷信的意义以及它是否与分析完全不同,目前存在很多争论。
有些人试图通过讨论数据科学家的工作来定义数据迷信:数据科学家所需的能力、他们扮演的角色、他们使用的工具和技术、他们工作的场所及其教育背景等。但这些并没有给出一个有意义的数据迷信定义。
与其按照人(数据科学家)或他们处理的问题来定义数据迷信,不如将其定义如下:
数据迷信是一门科学学科,它利用统计和数学等领域的定量方法及现代技术,开发出用于发现模式、预测结果和为复杂问题找到最佳解决方案的算法。
数据迷信和分析的区别在于,数据迷信可以协助甚至支持自动化完成对数据的分析,但分析是一种以人为中心的策略,充分利用各种工具,包括那些在数据迷信中发现的工具,来理解现象的本质。
数据迷信可能是这些概念中涉及面最广的,因为它涉及处理“数据”的整个科学和理论。我认为数据迷信是由计算机科学家设计的分析学,但在实践中,数据迷信往往侧重于对宏观问题的研究,而分析则侧重于解决特定行业或具体问题的挑战。
在许多现代企业中,分析已成为一种核心业务活动,这些企业通过数据驱动和以人为中心的业务运营与管理流程实现了数据的普及。
边缘分析(edge analytics)通常指的是分布式分析,在这种情况下,分析被内置到一些机器或系统中,通过这种方式,信息的生成与收集已经成为企业“自我决策”的自主活动。
边缘分析通常与智能设备相关,这种情况下,分析计算是在数据收集点(如设备、传感器、网络交换机或其他设备)进行的,与传统的数据管道传输方式(即采集数据、传输数据、清洗数据、集成数据、存储数据)不同,边缘分析将分析嵌入到数据收集设备中完成或就近完成。
数据普及是指数据开放,使每个人都可以并且应该通过工具来探索获取这些数据,而不是将数据局限于少数特权群体。
例如,传统的信用卡欺诈检测依赖于机器(如读卡器),并通过与授权“代理”的连接发送请求来验证一笔交易,算法需要在极短时间内(百分之一毫秒)完成授权或标记欺诈标签,最后,读卡设备接收授权指令后完成或拒绝交易操作。在边缘分析中,算法运行在设备本身上(如带有嵌入式分析的智能芯片读卡器)。
边缘分析通常与物联网(IoT)联系在一起。最近IDC在一份关于物联网IoT未来展望(FutureScape)的报告中指出,到2018年,40%的物联网数据将在网络中生成数据的边缘完成存储、处理、分析和响应。
随着物联网的发展,我们可能会看到对所谓的“万物分析”(Analytics of Things, AoT)有更多的关注,它指的是分析将给物联网数据带来独特价值的机会。
环境分析(ambient analytics)是另一个相关的术语,其名称意味着“无处不在的分析”。就像房间的灯光或音响常常不被注意,但为舞台构建了氛围一样,环境分析也会影响我们工作和娱乐的环境。
我们看到环境智能在日常生活中发挥作用,如检测血糖水平和注射胰岛素。同样,当你回到住家附近时,智能家居设备检测到相关信息,会自动调整温度和开启照明。环境分析超越了基于简单规则的决策,它利用算法来决定合适的行动路径。
毫无疑问,边缘和环境分析将继续挑战传统的以人为中心的管理方式和流程,传统管理方式下,分析结果(如对分析的理解、决策和采取的行动)以人为主导,而在边缘和环境分析中会有越来越多的自主决策与执行。
信息学(informatics)是信息技术和信息管理的交叉学科。实际上,信息学涉及用于数据存储和检索的处理技术。从本质上讲,信息学探讨信息是如何管理的,指的是支持流程化工作流的系统和数据生态系统,而不是对其中发现的数据进行分析。
在信息科学中常提到的健康信息学,专门用于医疗保健研究,是介于健康信息技术和健康信息管理之间的一种专业技术,它将信息技术、通信和医疗保健结合起来,以提高患者护理的质量和安全性。它位于人、信息和技术三者交汇处的中心。
医疗政策是指在一个社会中为实现特定的医疗目标而采取的决策、计划和行动。医疗政策制定者希望看到医疗服务变得更加经济、安全、高质量,信息技术和医疗信息技术往往是实现这一目标的重要手段。
实际上,最重要的一项工作是正确地定位数据资源,使其能够提供每位患者的360度完整健康状况视图,只有数据共享才能做到这一点(见图1-2)。
人工智能(AI)是一门“让计算机做需要人类智能才能做的事情的科学”。
人工智能和机器学习的区别在于,人工智能是指应用计算机完成形式识别与探索这类“智能”工作的广义概念,而机器学习是人工智能的一个子集,主要指应用计算机从数据中学习的概念。
机器学习是人工智能的一个子集,它可以根据数据进行学习和预测,不是仅仅根据特定的一组规则或指令完成事前规划的操作,而是通过算法训练自主识别大量数据中的模式。
人工智能(和机器学习)可以在分析生命周期中运用,以支持发现和探索(例如,数据是如何构建的,存在什么模式等)。人工智能在分析中的应用通常以机器学习(如上文所述)或认知计算的方式出现。
认知计算是一种独特的应用,它结合了人工智能和机器学习算法,试图复制(或模拟)人脑的行为。
认知计算系统被设计为像人一样通过思考、推理和记忆等方式处理问题。这种设计方法使认知计算系统具有一个优势,即它们可以“随着新数据的到来而学习和适应”并“探索和发现那些你永远不会知道去问的东西”。
认知计算的优势在于,一旦它学会了某种能力,它就永远不会忘记,而人类往往做不到这一点。
不幸的是,在人与算法的竞争中,人类常常输掉。人工智能的优势就在于此。因此,如果我们想成为聪明的人,就必须学会谦逊,因为在计算机世界里,我们的直觉判断可能不如依靠一组简单规则完成的算法。
关于作者:格雷戈里·S. 纳尔逊(Gregory S. Nelson),ThotWave的创始人和CEO,是国际分析研究所(International Institute for Analytics)的专家,也是杜克大学福卡商学院(Fuqua School of Business)的特邀教授。
本文摘自《数据分析的未来:企业全生命周期数据分析应用之道》,经出版方授权发布。
延伸阅读《数据分析的未来》
推荐语:融合了数据科学、设计思维和组织理论,全方位阐述如何高效达成高水平的企业级数据分析能力。