自然言语处理 NLP 发展简史
作者头像
  • 黄婷
  • 2020-08-16 05:38:16 7

从言语结构化的基本理论到拥有1750亿参数的GPT-3,让我们一起回顾自然语言处理(NLP)的百年发展历程。

言语的结构化

20世纪初,瑞士日内瓦大学的费迪南德·德·索绪尔(Ferdinand de Saussure)教授开创了一种将言语描述为“系统”的方法。他认为,意义是在语言的外部和语言各部分之间的关系和差异中产生的。他提出,语言的意义来源于语言之间的关系和对比,共享的语言系统使得交流成为可能。索绪尔教授将社会视为一个共享的规范体系,为合理和可扩展的思想提供了条件,从而引导个人做出不同的决定和行动。

遗憾的是,索绪尔教授的理论还未正式发表就于1913年去世。然而,他的学生阿尔伯特·薛施霭(Albert Sechehaye)和沙尔·巴利(Charles Bally)意识到了这项研究的重要性,他们整理了索绪尔教授的手稿和其他同学的笔记,最终出版了《普通语言学教程》一书,该书于1916年问世。这本书奠定了后来结构主义方法论的基础,成为现代语言学和结构主义语言学的开山之作。索绪尔教授也因此被誉为现代语言学之父,他对语言结构化的理论不仅影响了语言学领域,还为几十年后出现的结构化编程语言和人工智能技术奠定了理论基础。

人工智能的兴起

1950年,计算机科学之父阿兰·图灵(Alan Turing)发表了具有划时代意义的论文,预言了创造真正智能机器的可能性。由于“智能”这一概念难以精确定义,他提出了著名的“图灵测试”。如果一台机器能与人类展开对话(通过电传设备),并且不能被超过30%的裁判识别出其机器身份,则认为这台机器具有人类智能。

紧接着在1952年,生物学家阿兰·霍奇金(Alan Hodgkin)和安德鲁·赫克斯利(Andrew Huxley)开发了一个数学模型来解释章鱼巨型轴突中神经细胞的行为,霍奇金-赫克斯利模型展示了人类大脑如何通过神经元网络运作,首次将人类大脑的工作原理形象地展示出来。

这些研究成果在学术界引起了巨大反响,激发了人工智能(AI)的研究热潮,同时也推动了自然语言处理(NLP)和计算机技术的发展。

NLP 的早期理论基础

人们对NLP最早的探索始于机器翻译的研究。1947年,美国科学家韦弗(W. Weaver)博士和英国工程师布斯(A. D. Booth)提出了利用计算机进行自动翻译的设想,机器翻译从此进入历史舞台。

1957年,麻省理工学院的诺姆·乔姆斯基(Noam Chomsky)教授在他的著作《句法结构》中革新了语言的概念,提出要使计算机理解语言,就必须改变句子的结构。为此,他创建了一种语法,称为“短语结构语法”,该语法可以有条不紊地将自然语言句子转化为计算机可理解的格式。

1958年夏天,人工智能研究的先驱约翰·麦卡锡(John McCarthy)加入IBM信息研究部工作,研究符号运算及其应用。然而,IBM的Fortran表处理语言无法支持符号运算的递归、条件表达式、动态存储分配及隐式回收等功能。因此,麦卡锡带领MIT的学生团队开发了一种全新的表处理语言——LISP,赋予编程语言更强的数学计算能力。LISP语言后来被称为人工智能的“母语”,成为早期人工智能研究者的首选编程语言。

1964年,首个自然语言对话程序ELIZA诞生。该程序由麻省理工学院的人工智能实验室的约瑟夫·维岑鲍姆(Joseph Weizenbaum)使用MAD-SLIP语言编写,运行在IBM 7094计算机上。由于当时的计算能力有限,ELIZA只能通过重新排列句子并遵循简单的语法规则与人类进行简单交流。尽管如此,ELIZA的出现仍给人留下了深刻印象,甚至让人误以为计算机可以理解对话内容。

然而,在经历了12年的努力和耗费近2000万美元的资金后,机器翻译的成本仍然高于人工翻译,且没有任何计算机能够真正实现基本的对话。因此,在1966年,美国国家研究委员会(NRC)和自动语言处理咨询委员会(ALPAC)停止了对自然语言处理和机器翻译相关项目的资助,AI和NLP的发展因此陷入停滞。

NLP 的复兴

直到1980年,美国卡内基梅隆大学召开了第一届机器学习国际研讨会,标志着机器学习研究在全球范围内的复兴。在此期间,NLP界开始寻找新的突破。早期的机器翻译概念被推翻,新的思想促进了新的研究。

早期的NLP研究主要依赖于语言学和统计学的结合,大多数NLP系统都采用了复杂的“手写”逻辑规则。然而,随着时间的推移,这种理念逐渐被纯粹的统计学方法取代。20世纪80年代,得益于计算能力的增长和机器学习的发展,研究人员开始重新定位AI和NLP,用简单的近似方法取代了深入的分析方法,评估过程变得更加量化。

1981年,伟博斯在神经网络反向传播(BP)算法中具体提出了前馈神经网络模型MLP。随后,一些学者提出了MLP与BP训练相结合的理念。此外,罗斯·昆兰(Ross Quinlan)在1986年提出的决策树算法ID3,成为主流机器学习的重要里程碑。与黑盒神经网络模型不同,决策树ID3算法作为一种软件工具,通过使用简单的规则和清晰的参考,可以在更多实际问题中找到应用。

进入90年代,随着互联网的兴起,用于自然语言处理分析的统计模型迅速普及。纯粹的统计学方法在线上文本的大流量方面显示出巨大的价值。n元模型(n-gram)在数字识别和跟踪大量语言数据方面变得非常有用。

为了缓解n元模型估算概率时遇到的数据稀疏问题,研究人员提出了神经网络语言模型。1997年,LSTM递归神经网络(RNN)模型被引入,并在2007年找到了语音和文本处理的应用领域。目前,神经网络模型被认为是NLP中理解和生成文本和语音的最前沿研究。

2001年,法国AI专家约书亚·本吉奥(Yoshio Bengio)发表了一篇论文,提出了一种全新的语言神经网络模型。该模型使用前馈神经网络描绘了一种不使用连接来构成循环的人工神经网络。这种类型的网络在结构上与递归神经网络有很大不同。

本吉奥的新思路启发了许多基于神经网络的NLP学术研究,并在工业界得到了广泛应用,推动了NLP技术在未来几年的快速发展。此外,关于梯度消失、word2vec的雏形以及现代机器翻译技术都有本吉奥的贡献。

当代 NLP 研究

经过长期发展,自然语言处理(NLP)被系统地定义为人工智能的一个分支学科。除了机器翻译和人机交互外,NLP还涵盖了以下高级功能的研究:

  • 内容分类:包括文档摘要、内容警报、重复检测、搜索和索引。
  • 主题发现和建模:捕捉文本集合的主题和含义,进行高级分析。
  • 上下文提取:自动从基于文本的来源中提取结构化数据。
  • 情感分析:识别存储在大量文本中的总体情绪或主观意见,用于意见挖掘。
  • 文本到语音和语音到文本的转换:将语音命令转换为文本,反之亦然。
  • 文档摘要:自动生成摘要,压缩大量文本。
  • 机器翻译:自动将一种语言的文本或语音翻译成另一种语言。

2011年,苹果公司的Siri成为世界上第一个被普通消费者广泛使用的NLP/AI助手之一。Siri通过自动语音识别模块将所有单词转换为数字解释的概念,然后通过语音命令系统将这些概念与预定义的命令匹配,从而启动特定操作。通过使用机器学习技术,Siri能够识别和处理用户的口语形式,而不必与预定义的表达式完全匹配。

经过机器学习技术的训练,Siri能够显著提高翻译的准确性,并增加系统的词汇量。例如,Siri能够理解“我在哪里可以找到大数据专家?”这样的复杂问题,并提供合适的答案。

2014年6月8日,一个名为尤金·古斯特曼(Eugene Goostman)的电脑聊天程序成功让33%的人类裁判相信它是一个13岁的男孩,成为历史上首台通过图灵测试的计算机。

NLP 的未来

近年来,在NLP领域中,通过预训练语言模型在多个NLP任务上取得了突破性进展,受到了广泛关注。

前文提到,目前神经网络在训练过程中通常采用后向传播(BP)算法,通过对网络模型参数进行随机初始化,然后通过BP算法应用如SGD这样的优化算法来优化模型参数。而预训练的思想则是,模型的参数不再随机初始化,而是先在一个任务上进行训练得到一套模型参数,然后用这套参数对模型进行初始化,再进行训练。这种方法通过在大量语料上预训练语言模型,然后再将其应用于具体的下游NLP任务,从而提高了模型的能力。

得益于硬件算力的提升,预训练语言模型的参数规模呈指数级增长。其中,GPT模型是OpenAI在2018年提出的一种新的ELMo算法模型。该模型在预训练模型的基础上,只需进行少量微调即可直接应用于各种NLP任务,因此具有很强的迁移能力。2019年推出的GPT-2拥有15亿参数,而到了2020年推出的GPT-3已经拥有惊人的1750亿参数,不仅能轻松通过图灵测试,还能完成包括写代码在内的大多数NLP任务。

神经网络之父、图灵奖获得者杰弗里·辛顿(Geoffrey Hinton)表示:“鉴于GPT-3在未来的发展前景,可以说生命、宇宙和万事万物的答案,可能只需要4.398万亿个参数。”这一观点引发了广泛的讨论,也被认为是对NLP发展极限的预言。未来,随着人类计算能力的不断提升,包含全人类文明的GPT-N是否会成为NLP的终点?这仍然是一个值得思考的问题。

    本文来源:图灵汇
责任编辑: : 黄婷
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
简史言语自然处理发展NLP
    下一篇