自然语言处理(Natural Language Processing,简称NLP)是人工智能和语言学领域的交叉学科,主要任务是将自然语言(如英语或普通话)转化为计算机可以理解和处理的数据(数字)。同时,这种对世界的理解有时也可以用来生成可以表现这种理解的自然语言文本(即自然语言生成)。
然而,你知道吗?NLP的英文缩写“NLP”其实有两种不同的含义。除了自然语言处理之外,它还是神经语言编程(Neuro-Linguistic Programming,简称NLP)这一所谓“伪科学”的缩写。由于这两个领域名称相同,人们常常会混淆它们。
神经语言编程是由心理学家和语言学家创立的一种所谓的“伪科学”。它的英文全称是Neuro-Linguistic Programming,因此同样缩写为NLP。这项理论由理查德·班德勒(Richard Bandler)和约翰·格林德(John Grinder)于1970年代在美国加利福尼亚创立。班德勒最初学习的是计算机科学,但他对人类行为的研究十分感兴趣,广泛阅读心理学书籍,并经常对传统心理学提出质疑。格林德则是一位语言学家,他在加州大学任教。他们对传统心理学疗法的时间长、效果不持久感到不满,于是开始研究和模仿当时在人类沟通和心理治疗方面有杰出成就的大师们(如催眠治疗大师米尔顿·艾瑞克森、家庭治疗大师维吉尼亚·萨提亚和完形治疗创始人弗雷茨·皮尔斯),并总结出神经语言编程的理论框架。
他们认为,神经过程、语言和通过经验学习的行为模式之间存在联系,并且可以通过改变这些模式来实现特定的生活目标。班德勒和格林德声称,自然语言处理方法可以“建模”优秀人士的技能,使任何人都能掌握这些技能。尽管神经语言编程听起来似乎结合了一些行为科学和心理学知识,但它并没有得到科学界的认可,反而被视为一种伪科学。
相比之下,自然语言处理的起源要早得多。它始于1950年代,当时图灵提出了一种测试“思考机器”的方法。他指出,如果一台机器能够通过电传打字机进行对话,并且看起来像人类一样交流,那么这台机器就可以被认为具有思考能力。随后,在1952年,霍奇金-赫克斯利模型展示了大脑如何利用神经元形成网络。这些事件激发了人工智能(AI)、自然语言处理(NLP)和计算机的发展。
在1960年代,有两个非常成功的自然语言处理系统,一个是SHRDLU,它是一个受限制的词汇和操作系统的自然语言系统;另一个是ELIZA,它在某些情况下能够表现出类似人类的互动,但在有限的知识范围内。直到1980年代,大多数自然语言处理系统仍然依赖复杂的、人为设定的规则。然而,从1980年代末期开始,自然语言处理引入了机器学习算法,这导致了NLP的重大变革和发展。
1980年代末期,NLP经历了一场革命,早期的机器学习算法(如决策树)开始出现,但研究逐渐转向统计模型,这些模型可以做出概率决策。1997年,LSTM递归神经网络(RNN)模型被引入,并在2007年应用于语音和文本处理。2001年,Yoshio Bengio和他的团队提出了第一个神经“语言”模型——前馈神经网络,这种网络不使用连接来形成循环。在2011年,苹果公司的Siri成为了第一个广泛使用的NLP/AI助手之一。在Siri中,自动语音识别模块将用户的语音转换为数字概念,然后语音命令系统将这些概念与预定义的命令匹配,从而执行特定的操作。
近年来,由于大数据的可用性、强大的计算能力和改进的算法,自然语言处理技术迅速发展并在多个行业中得到广泛应用:
总之,自然语言处理技术已经从简单的规则驱动系统发展成为高度复杂和智能化的技术,为各行各业带来了巨大的变革。