清华自然言语处文迷信家孙茂松:深度学习受阻之后,我们还能做什么?
作者头像
  • 刘青
  • 2020-07-18 16:33:48 7

北京举办“智源大会” 推动全球人工智能学术和创新

10月31日,北京举办了“智源大会”,这是一场旨在打造全球领先的人工智能学术和创新生态的重要活动。会上,自然语言处理领域的国际领军人物、清华大学教授孙茂松接受了采访,并分享了他对自然语言处理领域的看法和未来展望。

孙茂松教授指出,当前大数据驱动的自然语言处理已经取得显著进展,但基于丰富知识的自然语言处理才刚刚起步。智源的目标是实现大数据和大知识双轮驱动的自然语言处理。为了实现这一目标,构建一个全球通用的人类知识库是关键。然而,目前这样的知识库尚未建成,因此这也是现阶段需要攻克的技术难题。

孙茂松教授访谈实录

孙茂松: 近年来,人工智能领域的发展大家更多关注的是图像识别方面的成就,例如人脸识别等。然而,图像只是智能的一部分,人类智能的最大特点在于语言。人工智能领域有句话叫做:“让计算机理解自然语言是人工智能皇冠上的明珠。”因此,下一步的关键任务是让机器理解人类语言,这在人工智能学科中占据重要地位。

自然语言处理方向的研究目标是根据历史发展线索设定的。近年来,自然语言处理的进步和图像识别的进步都依赖于深度学习,而深度学习的特点是需要海量数据进行训练。自然语言处理的相关领域,如语音识别和机器翻译,近年来发展良好,得益于大数据驱动。虽然这种方法可以快速提升性能,但也存在一些问题。大数据驱动的深度学习模型通常被视为黑箱,尽管看起来翻译效果不错,但实际上并没有真正理解语义,尤其在处理复杂语义时非常脆弱。

例如,如果句子中包含世界知识,翻译系统往往无法准确翻译。比如“前门快到了,请从后门下车”这样的句子,现在的所有计算机系统都无法正确处理,因为它们不了解“前门”这一概念。

孙茂松: 下一步我们需要真正理解语言,攻克人工智能的难关,需要知识驱动。我们提出口号,大数据驱动的自然语言处理已经做得不错,大知识驱动的自然语言处理才刚刚起步。在智源框架下,我们希望实现大数据和大知识双轮驱动的自然语言处理,这将是人工智能的一大突破。要实现这一目标,需要一个计算机可操作的人类知识库作为基础资源,但目前这样的知识库尚未建立。尽管世界上有些知识库,但还没有真正能够驱动自然语言处理的人类知识库,特别是常识库。我们希望在常识知识库和世界知识库方面进行尝试,从而在此基础上研究新的大数据和大知识结合的人工智能算法。

访谈问答

问: 您提到知识和数据互补,不同的人会有不同的知识,如何提炼人的常识?我们如何让机器学习?

孙茂松: 尽管知识体系看起来各有不同,但人类共有知识的核心是相对稳定的。比如“人是动物的一种”这样的知识,现在比较充分。然而,更详细的描述则较为匮乏。例如,谷歌、维基数据等大规模知识库实际上是大而不强的。以关羽为例,维基数据中关于关羽的描述包括他是武将、三国时期蜀国的将领等基本信息,但缺乏具体事迹的描述,如“过五关斩六将”等,这导致系统无法进行推理。因此,我们需要把这些总结出来,形成全人类共识的知识。

我们希望能够建立一个知识库,至少涵盖某一领域的详细信息。要做到这一点,不能完全依靠人工。文本中有描述关羽的事迹,但需要形式化。例如,“关羽在哪年哪月从麦城开了哪个门趁夜逃走”,这句话是有的,但需要抽取关键信息,如人物、地点、时间等,才能将句子转换为一阶谓词逻辑表达式,即变成数学公式,从而让计算机进行逻辑推理。

问: 黑箱对研究和应用会带来什么风险?

孙茂松: 黑箱并不完全是坏事。图灵测试本身就是一种黑箱测试。如果我们必须先了解人脑的机制才能做人工智能,那么直到今天人工智能也不会取得如此大的进展。黑箱并不是贬义词,它只是在不同阶段的不得已选择。如果能深入了解人脑机制再进行研究,一定会更加深入。例如,图像识别很容易受到攻击,因为它是一个黑箱模型,输入和输出之间存在许多变化,即使有99%的准确率,剩下的1%也可能导致问题。

举个例子,“The box was in the pen”这句话,机器翻译系统会将其错误翻译为“箱子在钢笔里”,因为缺乏知识。围栏这个词出现频率较低,系统会选择更常见的词“钢笔”。如果系统具备知识,就能判断这种翻译是错误的。

问: 如何构建适合全人类的知识库?如何训练机器去阅读这些材料?

孙茂松: 我们所说的主要是人类知识的核心部分,这部分是相对稳定的,即所谓的常识。超出常识范围的知识,相当于观点,不同人会有不同看法。我们需要刻画常识部分,例如在餐馆就餐的基本流程,无论在哪个国家,这些流程都是相同的。

观点是灵活的,所以我们提出“双轮驱动”,因为观点难以穷尽且因时而变。此外,知识库必须是高质量的,不能包含人为错误。

问: 使用较小的数据集是否会导致精度下降?如何在保护隐私的同时,仍能达到良好的效果?

孙茂松: 使用较小的数据集确实会导致精度下降。目前,大部分方法都依赖大数据,小数据的研究还处于初级阶段。在特定领域,如果有足够的知识引导,使用小数据集仍然有可能取得成功。然而,目前还没有统一的解决方案,不像深度学习那样有一套普遍适用的工具。

问: 构建庞大的世界知识库的最大难点是什么?

孙茂松: 这个知识库不能完全依靠专家来编写,需要高水平的人才,花费大量时间和精力才能做好。在中国,这样的条件基本不具备,因为科研评价体系过于急功近利。构建知识库需要对世界万物有准确的把握,而这是一件非常困难的事情。目前,我们尝试从现有知识库中提取信息,并通过文本挖掘进一步补充知识库。然而,将互联网上的所有文本形式化,使其成为谓词逻辑表达式,是一项艰巨的任务。目前,这项工作的瓶颈在于机器难以准确分析出主谓宾结构。

问: 图神经网络的发展潜力如何?

孙茂松: 图神经网络的算法研究相对常规,并没有特别的创新。将现有神经网络方法应用于图结构是一种自然的扩展。近两年,图神经网络受到关注,是因为端到端的方法已经走到极致,科研红利基本耗尽。图神经网络的挑战在于如何构建图结构,以及如何从图中抽取知识。

问: 当前深度学习的局限性有哪些?

孙茂松: 目前深度学习的优势已经得到了广泛的应用,但其局限性也逐渐显现。例如,机器翻译在处理复杂语义时仍有困难。端到端的方法虽然强大,但在某些情况下表现并不理想。因此,我们需要引入知识库来解决这些问题。

问: 国内在自然语言处理领域的研究现状如何?

孙茂松: 从研究角度来看,国内自然语言处理领域的水平在国际上处于领先地位,不逊于斯坦福、麻省理工等顶尖机构。然而,自然语言处理领域缺少具有里程碑意义的突破,例如图像领域的ImageNet。目前,语音识别和机器翻译两个方向取得了较大进展,但这些主要由企业推动。从发表高水平论文的角度来看,国内自然语言处理研究做得不错,但从实际效果来看,还需要加强。工业界在推动应用方面发挥了重要作用,尤其是在计算能力方面。

问: 工业界在自然语言处理领域的作用是否会持续增强?

孙茂松: 工业界在利用学术界创新成果方面发挥了重要作用。0到1阶段的创新大多由学术界完成,1到2阶段则由学术界和工业界共同推动。3到N阶段则主要由工业界主导。学术界应该专注于0到1阶段的创新,培养人才,解决更深层次的问题。

    本文来源:图灵汇
责任编辑: : 刘青
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
家孙清华受阻迷信深度言语之后自然学习我们
    下一篇