自然言语处理简介
作者头像
  • 2021-01-20 12:29:24 3

什么是自然语言处理

自然语言处理(Natural Language Processing,简称NLP)是一种利用计算机来处理、理解和生成人类语言的技术。它是人工智能的一个重要分支,结合了计算机科学和语言学的知识,也常被称为计算语言学。自然语言是区分人类与其他动物的关键特征。没有语言,人类的思维和交流将无法实现,因此自然语言处理体现了人工智能的最高目标——使计算机具备处理自然语言的能力。

从研究内容来看,自然语言处理涵盖了语法分析、语义分析和篇章理解等多个方面。从应用角度来看,自然语言处理具有广泛的应用前景。特别是在信息时代,自然语言处理的应用十分多样,包括机器翻译、手写体和印刷体字符识别、语音识别和文本转语音、信息检索、信息抽取与过滤、文本分类与聚类、舆情分析和观点挖掘等。它涉及到与语言处理相关的数据挖掘、机器学习、知识获取、知识工程、人工智能研究和语言学研究。

值得注意的是,自然语言处理的兴起与机器翻译密切相关。机器翻译是指利用计算机自动将一种自然语言翻译成另一种自然语言。例如,将英文"I like Beijing Tiananmen Square"翻译成中文“我爱北京天安门”,或者反之。人工翻译需要受过专门训练的双语专家,耗时耗力。尤其在需要翻译专业文献时,还需要翻译者具备相关领域的知识。全球有数千种语言,联合国的工作语言就有六种之多。如果能够通过机器翻译实现准确的语言转换,将大大提高人类沟通和理解的效率。

《圣经》中有一个故事讲述了巴别塔的传说。巴比伦人想建造一座直通天堂的塔,但由于上帝让他们语言混乱,导致他们无法继续建造。这个故事象征着人类渴望拥有共同的语言。机器翻译被视为“重建巴别塔”的伟大创举。如果能够实现不同语言之间的自动翻译,我们将能够理解世界上任何人说的话,与他们进行交流和沟通,不再为语言不通而困扰。

实际上,“人工智能”作为一个研究领域被正式提出时,创始人认为计算机国际象棋和机器翻译是两个标志性任务。他们认为,只要国际象棋系统能够击败人类世界冠军,机器翻译系统达到人类翻译水平,就能宣告人工智能的成功。1997年,IBM的深蓝超级计算机击败了国际象棋世界冠军卡斯帕罗夫。然而,机器翻译至今仍未达到人类翻译的水平,这表明自然语言处理是多么困难。

自然语言处理起源于美国。二战后,20世纪50年代,当电子计算机还处于初级阶段时,人们就开始探索如何利用计算机处理人类语言。当时,美国希望通过计算机将大量俄语材料自动翻译成英语,以便了解苏联的科技进展。研究人员受到破译军事密码的启发,认为不同的语言只是对“相同语义”的不同编码,因此尝试采用解码技术来破解这些语言。

1954年1月7日,美国乔治敦大学和IBM公司合作实验成功地将超过60句俄语自动翻译成英语。尽管这个机器翻译系统非常简单,只包含6个语法规则和250个词汇,但由于媒体的广泛报道,人们普遍认为这是一个巨大的进步。这导致美国政府加大了对自然语言处理研究的投资。实验完成后,研究者们自信地宣称,三到五年内就可以完全解决从一种语言到另一种语言的自动翻译问题。他们认为只要制定好各种翻译规则,通过大量规则的堆砌就可以完美地完成语言间的自动翻译。

然而,实际操作中,理解人类语言远比破译密码复杂得多,因此研究进展非常缓慢。1966年的一份研究报告指出,经过十年的研究,结果远未达到预期,因此支持资金急剧下降,导致自然语言处理(尤其是机器翻译)的研究陷入长达二十年的低潮。直到20世纪80年代,随着电子计算机计算能力的迅速提高和制造成本的大幅下降,研究人员重新关注自然语言处理这一富有挑战的领域。三十年间,研究者们认识到简单的语言规则堆砌无法真正理解人类语言。研究发现,通过对大量文本数据的自动学习和统计分析,可以更好地解决自然语言处理的问题,这种思想被称为自然语言处理的统计学习模型,至今仍在不断发展。

自然语言处理的主要挑战

自然语言处理面临的挑战众多,但关键在于消除歧义。这包括词法分析、句法分析和语义分析中的歧义问题,简称为消歧。正确的消歧需要大量的知识,包括语言学知识(如词法、句法、语义、上下文等)和世界知识(与语言相关的知识)。这带来了自然语言处理的两个主要挑战。

首先,语言中充满了大量的歧义,主要体现在词法、句法和语义三个层次上。歧义的产生是因为人类活动非常复杂,而语言的词汇和句法规则是有限的,这就导致同一种语言形式可能具有多种含义。例如,单词定界问题是词法层面的消歧任务。在口语中,词与词之间通常是连续说出来的。在中文等语言中,词与词之间缺少自然的分隔符。因为单词是承载语义的最小单元,要处理自然语言处理,首先要解决单词边界的界定问题。特别是中文文本通常由连续的字序列组成,词与词之间缺少自然的分隔符,因此中文信息处理比英文等西方语言多一步工序,即确定词的边界,我们称之为“中文自动分词”任务。简单地说,就是要由计算机在词与词之间自动加上分隔符,从而将中文文本切分为独立的单词。例如,句子“明天天气阴沉”的带有分隔符的切分文本是“明天|天气|阴沉”。中文自动分词处于中文自然语言处理的底层,是公认的中文信息处理的第一道工序,扮演着重要的角色,主要存在新词发现和歧义切分等问题。我们注意到,正确的单词切分取决于对文本语义的正确理解,而单词切分又是理解语言的最后一道工序。这样的“鸡生蛋、蛋生鸡”的问题自然成了(中文)自然语言处理的第一条拦路虎。

其他层级的语言单位也存在各种歧义问题。例如在短语层面,“出口彩电”可以理解为动宾关系(从国外出口了一批彩电),也可以理解为偏正关系(从国外出口的彩电)。又如在句子层面,“做手术的是她的父亲”可以理解为她父亲生病了需要做手术,也可以理解为她父亲是医生,帮别人做手术。总之,同一个单词、短语或句子可以有多种可能的理解,表示多种可能的语义。如果不能解决好各级语言单位的歧义问题,我们就无法正确理解语言要表达的意思。

另一个方面,消除歧义所需的知识在获取、表达和应用上存在困难。由于语言处理的复杂性,合适的语言处理方法和模型难以设计。例如上下文知识的获取问题。在试图理解一句话时,即使不存在歧义问题,也需要考虑上下文的影响。所谓“上下文”指的是当前所说这句话所处的语境,例如说话人的环境,或者是这句话的前几句或后几句等。如果当前这句话中有指代词时,我们需要通过这句话后面的句子来推断这个指代词指的是什么。例如“小明欺负小亮,因此我批评了他”。在其中的第二句话中的“他”是指代“小明”还是“小亮”?要正确理解这句话,就需要了解上一句“小明欺负小亮”意味着“小明”做得不对,因此第二句中的“他”应该是指代“小明”。由于上下文对当前句子的暗示方式多种多样,因此如何考虑上下文影响是一个自然语言处理中的主要挑战之一。

再如背景知识问题。正确理解人类语言需要足够的背景知识。举个简单的例子,在机器翻译研究初期,人们常用“心不足而力不足”这句话来说明机器翻译任务的艰巨性。在英语中,“The spirit is willing but the flesh is weak”意为“心有余而力不足”。然而,某机器翻译系统将这句话翻译成俄语,然后再翻译回英语时,却变成了“The Volka is strong but the meat is rotten”,意为“伏特加酒很浓,但肉已经腐烂”。从字面意义上看,“spirit”(烈酒)与“Volka”(伏特加)对译似乎没有问题,而“flesh”和“meat”都有肉的意思。那么这两句话为什么在意义上会背道而驰呢?关键问题在于机器翻译系统在翻译过程中对英语成语缺乏理解,仅仅从字面意义上进行翻译,结果自然失之毫厘,差之千里。

从上述两个主要挑战来看,自然语言处理的难点在于人类语言的复杂性和语言描述的外部世界的复杂性。人类语言承担着表达情感、交流思想和传播知识的重要功能,因此需要具有强大的灵活性和表达能力,而理解语言所需的知识却是无止境的。

自然语言处理的发展趋势

目前,自然语言处理主要通过两种思路来实现:一种是基于规则的理性主义方法,另一种是基于统计的经验主义方法。理性主义方法认为,人类语言主要由语言规则产生和描述,因此只要能适当地将人类语言规则表示出来,就能理解人类语言并完成各种自然语言处理任务。经验主义方法则认为,从语言数据中获取语言统计知识,有效建立语言的统计模型。因此,只要有足够多的用于统计的语言数据,就能理解人类语言。

然而,当面对现实世界中充满模糊性和不确定性的挑战时,这两种方法都面临着各自的困境。例如,虽然人类语言有一定的规则,但在实际应用中往往伴随着大量的噪音和不规范性。理性主义方法的一大弱点是鲁棒性差,一旦与规则稍有偏离就无法处理。而经验主义方法又不能无限地获取语言数据进行统计学习,因此也无法完美地理解人类语言。自20世纪80年代以来,基于语言规则的理性主义方法受到了质疑,大规模语言数据处理成为了目前和未来一段时间内自然语言处理的主要研究方向。统计学习方法越来越受到重视,自然语言处理中越来越多地使用机器自动学习的方法来获取语言知识。

进入21世纪,我们已经进入了以互联网为主要标志的海量信息时代。这些海量信息大多是以自然语言表示的。一方面,海量信息为计算机学习人类语言提供了更多的“素材”,另一方面,也为自然语言处理提供了更加广阔的运用舞台。例如,作为自然语言处理的重要应用,搜索引擎逐渐成为人们获取信息的重要工具,涌现出以百度、谷歌等为代表的搜索引擎巨头;机器翻译也从实验室走入寻常百姓家,谷歌、百度等公司都提供了基于海量网络数据的机器翻译和辅助翻译工具;基于自然语言处理的中文输入法(如搜狗、微软、谷歌等输入法)成为计算机用户的必备工具;带有语音识别的计算机和手机也越来越普及,帮助用户更高效地工作和学习。总之,随着互联网的普及和海量信息的涌现,自然语言处理正在人们的日常生活中扮演着越来越重要的角色。

但是,面对海量的大规模文本数据,人们面临的一个严峻挑战是如何有效地利用这些信息。单纯依靠统计方法已经无法快速有效地从海量数据中学习语言知识。随着2013年word2vec技术的发布,以神经网络为基础的深度学习技术开始在自然语言处理中广泛应用。深度学习的分布式语义表示和多层网络架构具有强大的拟合和学习能力,显著提升了自然语言处理各项任务的功能,成为现阶段自然语言处理的主要技术方案。

深度学习是一种纯粹的数据驱动技术方案,需要从大规模标注数据中学习特定任务相关的复杂模式。一方面,一些学者开始探索面向大规模无标注文本数据的深度学习模型,如ELMo、GPT、BERT等,可以看作是从大规模数据中学习知识的极致追求;另一方面,现有的深度学习技术尚未充分考虑人类积累的丰富知识(包括语言知识、世界知识、常识知识、认知知识、行业知识等)。如果将深度学习视为经验主义方法,将符号知识视为理性主义方法,那么如何充分发挥基于规则的理性主义方法和基于统计的经验主义方法的优势,两者相互补充,更好地、更快地进行自然语言处理,仍然是我们需要探索的重要课题。

自然语言处理作为一个年轻不到一个世纪的新兴学科,正在快速发展。回顾自然语言处理的发展历程,经历了高低起伏。如今我们正面临着新的挑战和机遇。例如,目前的网络搜索引擎基本上还停留在关键词匹配阶段,缺乏深层次的自然语言处理和理解。语音识别、文字识别、问答系统、机器翻译等目前也只能达到基本水平。自然语言处理作为一个高度交叉的新兴学科,无论是探索自然的本质还是付诸实践应用,在未来必定会有令人期待的惊喜和迅猛的发展。

与计算机视觉相比,自然语言处理有何特点

从图像和语言两种模态来看,对文本处理技术的大规模应用要早于计算机视觉。将图像和语言中的处理对象做一个不太严谨的对比。如下图所示,大致上像素类似于语言中的字母;图像中的对象类似于语言中的单词/概念;图像中对象组成的场景类似于语言中的句子表达的语义;视频则类似于语言中的篇章(文章)。

在这种类比下看,自然语言处理(NLP)/信息检索(IR)在单词层面的处理要比计算机视觉(CV)中的图像识别简单得多,只需要做一些tokenization、lemmatization、stemming等(中文复杂一些需要额外做自动分词),就可以应用关键词匹配完成许多任务,例如信息检索、文本分类、拼写纠错、情感分析、关键词提取等,实际上已经得到了广泛的应用,如搜索引擎、拼音输入法、新闻分类、阅读推荐等。

而由于图像中对象的复杂性和多样性,仅在对象识别层面,甚至特定的人脸识别,还有很多技术挑战。只不过近年来,由于深度学习对非结构数据的强大表示和学习能力,使得对象识别逐渐走向实用化。

而进入到更高层面,例如面向图像的场景图构建,面向文本的句法语义分析,都需要对复杂语境(上下文)的精确而强大的建模能力。因此,自然语言处理和计算机视觉在高层任务中都将面临共同的关键挑战,都可以归结为复杂语境下的多对象(图像中是不同对象,文本中是不同概念)的语义组合问题。

中文NLP与英文NLP的异同

从应用文本分析技术来看,如果只做主题聚类、文本分类等任务,中英文的最大区别在于,中文需要做自动分词,相关的工具包已经很多,包括Jieba、哈工大的LTP、北理工的ICTCLAS,还有我们团队研发的THULAC。当然,在文本分类时,到底是选择词语还是N-gram作为特征,在SVM+BOW时代曾是个问题。进入深度学习时代,可以直接使用基于字符的神经网络模型。

从自然语言处理研究的角度来看,中英文在词性标注、句法分析等任务上有很大差异。主要体现在英语有明显的屈折变化(单复数、时态等),而汉语缺乏这些屈折变化,即有学者总结的“汉语重义合,英语重形合”。因此,英语中一个词被标记为动词还是名词,几乎没有争议;而在汉语中,一个词应该被标记为动词还是名词,例如“热爱学习”、“休息光荣”中的“学习”、“休息”,如果按照英语语法规范应被标记为名词。著名语言学家沈家煊先生提出了“汉语动词和名词不分立”的理论。在句法分析层面,汉语也有一些自己的特点,具体需要请教专业的语言学家解答。

在相关分析任务的错误率方面,中文分析功能明显低于英文的原因不仅在于中文缺乏屈折变化、有更多的自由度从而增加了分析难度,还在于中文标注资源相对较少、标注质量相对较低。语言资源的标注需要语言学家和计算机科学家的紧密合作,耗费大量精力和时间,在国内环境中尤为艰难,希望未来有所改善。

从更广泛的语言研究角度来看,由于中英两种语言承载了不同的人类群体的文化信息,因此在深层的文化内涵上会有显著的不同,例如两种语言的词汇联想网络、隐喻风格等,可能会有更大的差异。或许在自然语言处理技术日益成熟之后,我们可以通过语言更加定量地分析两种不同文化之间的差异。

    本文来源:图灵汇
责任编辑: :
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
言语自然处理简介
    下一篇