近年来,人工智能(AI)领域不断传来好消息,各大科技巨头纷纷加大在该领域的投入力度,积极招募相关人才。近期我也收到了不少关于人工智能的咨询和讨论,不得不指出,有时大家对人工智能的理解确实存在偏差。人工智能是一个涵盖面极广的概念,不仅限于计算机、通信、声学和光学等领域,也不是简单的机器学习(如深度学习和强化学习)所能覆盖的。然而,基于大数据和机器学习的狭义人工智能,确实已经在很大程度上改变了我们的生活方式,比如搜索引擎、电子商务、广告、社交媒体、语音识别等。
长期以来,人们普遍认为语音识别是人工智能中最关键的一环,甚至将其视为最接近人工智能的领域。但实际上,这是一种误解。语音识别只是人类交流的一种方式,与按键、触摸、手势等方式并无本质区别。此外,尽管有人认为语音识别推动了人类智慧的发展,但目前并没有确凿的证据支持这一观点。目前,对于人类智慧的形成机制,我们还知之甚少,而对于语音识别而言,它主要是作为一种信息传递的工具。
鉴于以上认识和误解,我认为有必要撰写一篇科普文章,帮助大家更好地理解人工智能。虽然我对这个领域并不十分精通,但我可以从基础声学的角度出发,讨论一下人工智能的基本概念。目前,这类通俗易懂的资料相对较少,希望能引起更多学术界和产业界专家的关注和讨论。
在此,我要明确自己的观点:在当前的人工智能应用中,语音识别并不是最关键的因素,其对我们生活的影响也相对有限。尽管经过十几年的发展,尤其是在结合深度学习之后,语音识别的精度已经达到了很高的水平,但进一步提升的难度很大。然而,即使精度达到99%,我们仍对其不满意,这主要是因为我们错误地将语言理解的概念附加到了语音识别上。实际上,语音识别只是人工智能的一个小分支,现在也可以被视为深度学习的一个子领域。就像人类的听觉系统一样,语音识别只是将声音转化为人类可理解的信号,而在计算机应用中,则是转化为文字。
那么,真正关键的是什么?
从各大科技巨头发布的宣传材料和相关信息来看,他们都在追求自然语言处理(Natural Language Processing,NLP)或自然语言理解(Natural Language Understanding,NLU)的突破。 当然,这也得益于基础声学和语音识别的进步。基础声学和语音识别解决了计算机“听得见”的问题,而NLP则致力于解决计算机“听得懂”的问题。因此,“听得懂”才是未来十年内最关键的问题。接下来,我将对NLP的概念及其国内外的学习资源进行盘点与分析。
语音和语言有何区别?
首先,我们需要明确语音和语言的区别。语音(Speech)是语言(Language)的载体,是由人的发音器官发出的,承载了一定的语言意义,而语言才是承载人类智慧的媒介。简单地说,语音是天生就存在的,婴儿的咿呀声也算是一种语音,甚至他们的哭声也具有一定的意义。而语言则是通过学习不断进化的。
为什么人类进化过程中选择了语音作为主要的交流手段?一般认为,这是因为语音具有独特的优势,比如声音比光更容易传播,且不受昼夜变化的影响,传播范围也更广。当然,也有一些科学家持不同意见,比如很多动物的听觉系统比人类更加发达,为什么它们没有进化出语音交流的方式?这个问题我们将在后续的文章中探讨。事实上,动物界中很多动物也会发出声音进行信息交流,但仅仅依靠语音交流是不够的。
单独强调语音而不提及语言是没有意义的。当然,语言不仅仅是通过语音来传达的。语音不易保存和搜索,于是人类发明了文字。文字虽然通过视觉来感受,但也只是帮助我们理解和映射语言的一种方式。象形文字最初与视觉有直接联系,但后来无论是汉语还是其他语言,都进行了抽象化处理,与听觉和视觉的关联变得不那么明显。至此,语言已经完全抽象出来,与我们所理解的概念紧密相连,远远超出了语音、图像等识别的范畴,甚至数学也成为了一种语言。
因此,当人类利用语言来存储知识和表达概念时,计算机和机器人也必须学会理解和适应这种表达方式。也就是说,在未来,计算机和机器人必须具备理解语言的能力,这是极为复杂且承载着人类知识传承的任务。虽然我们已经取得了一些进展,但短期内机器理解语言还难以取得实质性突破。这一领域需要更多优秀人才的加入,这也是我撰写这篇文章的目的之一,希望人才的涌入能带来更多的希望和进步。
如何描述和定义NLP?
事实上,自然语言处理(NLP),或者说自然语言理解(NLU),或者计算语言学(Computational Linguistics,CL),很难有一个精确的定义。1999年,美国计算机学家Bill Manaris曾这样描述:自然语言处理是一门研究人类与人类、人类与计算机之间语言问题的学科。NLP研究语言能力的模型,并通过建立计算机框架来实现这些模型,同时提出相应的方法不断完善这些模型,并设计各种实用系统,探讨这些系统的评测技术。我认为这个定义比较准确,但又过于宽泛。因此,很多时候我们仍然感到困惑,但这并不是问题,因为语言本身就是一个极其复杂且充满挑战的概念。
近年来,NLP的研究得到了前所未有的重视,并取得了显著的进步,逐渐发展成为一门独立的学科。NLP与其他技术如基础声学、语音识别等相互渗透,形成了众多新的研究分支。这些分支的发展在一定程度上混淆了概念,导致很多人把语音识别等同于NLP。
NLP涉及哪些研究内容?
自然语言理解的研究内容非常广泛,我们在这里只能列举其中的一部分,包括中文自动分词(Chinese Word Segmentation)、词性标注(Part-of-Speech Tagging)、句法分析(Parsing)、自然语言生成(Natural Language Generation)、文本分类(Text Categorization)、信息检索(Information Retrieval)、信息抽取(Information Extraction)、文字校对(Text Proofing)、问答系统(Question Answering)、机器翻译(Machine Translation)、自动摘要(Automatic Summarization)、文字蕴涵(Textual Entailment)等。其中,基础声学和语音识别等相关学科也可以纳入这个研究范畴。
自然语言理解的目标是通过图灵测试,涵盖语音、形态、语法、语义及语用等多个方面,并解决人类语言中的因果、逻辑和推理问题。这是非常重要的,因为尽管大数据可以揭示历史规律和预测趋势,但如果缺乏因果关系和逻辑推理,计算机和机器人就无法为人类提供有价值的建议,甚至是决策。
NLP当前面临哪些难点?
这个问题有很多方面。正如我们之前提到的,人类的语言融合了语音和文字,实际上是听觉和视觉的结合,而不是割裂开的。但现在这两个学科是独立发展的,人为造成了研究上的困难。此外,人类的语言多样性极大,每种语言的表达方式也各不相同。理想主义者甚至认为人类的一些语言知识是与生俱来的,这有一定的实验支持。然而,即使是经验主义者也认为语言是通过感官和人脑的联想与抽象获得的。这是一个大问题,因为它让很多研究人员感到困惑,科学的进步最怕遇到这种困难。很多时候,我们将科学的进步归因于哲学的进步,没有思路就很难找到突破点,这需要基础研究的进展。
当然,NLP目前面临的实际技术难题在于语义的复杂性,包括因果关系和逻辑推理的上下文等。解决这些问题的主要思路仍然是深度学习(Deep Learning)。深度学习为研究人员提供了全新的视角,尽管这不是最新技术,但在BP神经网络兴起时,学术界和产业界都非常活跃,因为研究人员终于找到了解决问题的线索。后来,BP神经网络几乎没有实质进展,逐渐冷却下来。深度学习扩展了神经网络的层次,并且大数据的积累和并行计算的增强为其奠定了基础,这也是最近机器学习火热的原因。因此,基于大数据和并行计算的深度学习将为NLP带来长足的进步,但要达到人类的理解水平,仅靠这种方法也很难实现。
NLP的学习资源有哪些?
我一直强调自然语言理解的重要性,文字是知识传承的重要方式,因此也提供一些参考资料供大家参考。但这个领域的科普书籍非常稀缺,我只能推荐一些书籍和网上资源供大家学习参考。
首先,我建议大家先看斯坦福大学和哥伦比亚大学的视频学习课程,这些课程都是英文的。国内也有几位老师的公开视频可以参考,比如宗成庆老师或关毅老师的自然语言理解课程,冯志伟老师的计算语言学课程也很不错。感兴趣的读者可以到声学在线的网站上查找这些资源。
其次,推荐一些书籍。首推Daniel Jurafsky和James H. Martin合著的《Speech and Language Processing》,这是国内外的主要教材之一。此外,这两位作者还有几本相关书籍也非常值得一看。国内也有冯志伟老师翻译的《自然语言处理综论》可供参考。对于数学基础较好的读者,推荐阅读《数学之美》(吴军)和《统计学习方法》(李航)。对于计算机编程基础较好的读者,推荐阅读《机器学习实战》(Peter Harrington)和《Python自然语言处理》(Steven Bird)等。
最后,推荐一些学术会议。通过查询这些学术会议可以了解很多学术进展,更重要的是,可以通过这些学术组织的会员和文章了解许多相关研究单位。这些学术会议包括:ACL(The Association for Computational Linguistics)、AAAI(Association for the Advancement of Artificial Intelligence)、ICCL(The International Committee on Computational Linguistics)、COLIPS(The Chinese and Oriental Languages Information Processing Society)以及中文信息学会等。
NLP有哪些知名的研究机构?
根据声学在线的众多朋友提供的信息,虽然不一定全面,但这些研究机构(排名不分先后)包括:斯坦福大学自然语言处理研究小组、卡内基梅隆大学语言技术研究院、哥伦比亚大学自然语言处理研究组、约翰霍普金斯大学语言和语音处理研究组、康奈尔大学NLP研究组、宾夕法尼亚大学NLP研究组、伊利诺伊大学香槟分校NLP团队、南加利福尼亚大学自然语言研究组、爱丁堡大学语言与计算研究所、谷歌苏黎世研究院、亚马逊NLP研究组、香港科技大学NLP实验室、中科院计算机所自然语言处理研究组、北京大学计算语言学研究所、清华大学人机交互与媒体集成研究所、中科院声学所语言声学与内容理解重点实验室、中科院自动化所模式识别重点室、百度自然语言处理部、中科大人机语音通信研究评测实验室、哈尔滨工业大学计算机学院智能技术与自然语言处理研究室等。
总之,随着深度学习的发展,自然语言理解取得了许多进展,但NLP所涉及的语言问题依然非常复杂,短期内难以取得突破。正因为有这些挑战,才更需要更多有才华的人才不断投入这个领域。这是未来数十年的新兴行业,优秀的毕业生可能会获得丰厚的薪酬。当然,这也带来了虚高的投入风险,可能会给行业发展带来一些阻碍。
via:声学在线
End.