人工智能笔记-自然语言处理
作者头像
  • VR动态
  • 2021-09-19 10:18:37 5

1.1 概述

自然语言是人们日常使用的语言,如汉语、英语、法语等,它是人类学习和沟通的重要工具。据历史数据显示,人类通过语言文字记录和传播的知识占到了总知识量的80%以上。而在计算机应用中,用于数学计算的比例仅为10%,用于过程控制的比例不足5%,剩余的约85%主要用于处理语言文字。

自然语言处理(Natural Language Processing,NLP)又称自然语言理解(Natural Language Understanding,NLU),自人工智能研究初期就成为重要课题,旨在探索人类理解自然语言的智能行为。近年来,随着深度学习和人工智能的快速发展,NLP成为了研究热点。如果计算机能够理解自然语言,人机交互将更加便捷,这不仅是一项技术突破,还将有助于揭示人类智能的秘密,加深我们对语言能力和思维本质的理解,对于语言教学和学习也将带来巨大帮助。

从研究内容和方法来看,NLP涉及多个学科,包括认知科学、计算机科学、语言学、数学和逻辑学、心理学等。研究范围涵盖了对人脑语言认知机制、语言习得与生理能力的探索,还包括语言知识的表达方式、语言与现实世界的关系、语言结构、语言现象的运用规律和演变过程,以及不同语言之间的语义关系等方面。因此,NLP是现代信息技术研究的重要组成部分。

1.2 技术框架

1.2.1 概述

NLP的技术框架包括词法分析、句法分析、语义分析和篇章分析等多个层面。这些技术虽然不是NLP系统的最终目标,但在大多数NLP系统中都有广泛应用。NLP技术可以根据不同的分类标准进行划分,这里主要采用两种分类原则:一是基于分析对象语言单位的粒度,二是基于分析内容性质的不同。前者包括词汇、语句和篇章,后者则包括形态学、语法学、语义学和语用学。

1.2.2 基于分析对象语言单位的分类

词法分析 是计算机科学中将字符序列转换为单词序列的过程。词法分析器通常以函数的形式存在,供语法分析器调用。词法分析主要涉及的技术包括分词、词性标注和命名实体识别等。

分词

分词可分为人工分词和自动分词。自动分词主要有基于词典的方法、基于统计的方法和混合方法。基于词典的方法需要分词词典、文本扫描顺序和匹配原则。文本扫描顺序有正向扫描、逆向扫描和双向扫描。匹配原则有最大匹配、最小匹配、逐词匹配和最佳匹配。基于统计的方法主要使用统计模型,如互信息、N元文法模型、神经网络模型、隐马尔可夫模型和最大熵模型等。这些模型通过计算字与字的相邻共现概率来确定词语。

词性标注

词性标注是确定每个词的语法范畴,包括代词、名词、动词等。词性标注的方法主要分为基于统计的方法、基于规则的方法和两者的结合。早期基于统计的方法包括CLAWS系统,使用概率统计的方法进行自动词性标注。基于规则的方法则是通过人工构造规则来实现词性标注。

命名实体识别

命名实体识别(NER)主要识别文本中的人名、地名、时间等专有名词。NER方法分为基于规则和词典的方法、基于统计的方法和混合方法。基于规则的方法依赖于手工构造的规则模板,而基于统计的方法则使用人工标注的语料进行训练。混合方法则将两者结合,以提高识别的准确性和效率。

1.2.3 基于内容特性的分类

NLP的核心在于理解自然语言。Shwartz指出,理解自然语言的程序需要解决思维处理、语言输入表示和客观知识三个方面的问题。因此,一个NLP系统需要具备语法知识、语义知识和语用知识。

形态分析 主要研究语素的构成和词的变化规则。语法分析 处理句子的结构关系,如上下文无关语法、转换语法等。语义分析 研究词语和句子的意义,包括词汇级、句子级和篇章级的语义分析。语用分析 则从使用者角度研究语言的实际使用情况,包括选择、制约和影响等。

1.3 算法模型

1.3.1 传统算法模型

传统算法模型通常基于隐马尔可夫模型(HMM)。EM算法是解决不完全数据参数估计的经典方法,广泛应用于统计自然语言处理中,如HMM的向前-向后算法、PCFG的向内-向外算法等。

1.3.2 基于深度学习的算法模型

基于深度学习的算法模型是当前主流方法,主要包括递归神经网络(RNN)、循环神经网络(RNN)和卷积神经网络(CNN)。RNN通过递归结构逐步合成短语语义,最终得到整句话的语义。循环神经网络(RNN)通过循环结构逐个输入文本中的词,并保留所有上文信息。卷积神经网络(CNN)通过卷积核对文本局部信息进行建模,并通过池化层整合全局信息。

1.4 开源项目

自然语言处理领域涌现了许多知名开源项目,这些项目在不同方面推动了NLP的发展。例如,IKAnalyzer、结巴分词、腾讯文智等,这些项目分别在中文分词、语义处理等领域提供了强大的支持。

1.5 发展瓶颈

尽管NLP取得了显著进展,但仍存在一些挑战。中文分词过程中,由于上下文语境的差异,可能出现多种分词结果。词性标注和语法分析同样存在困难,尤其是词义消歧问题,需要精准理解歧义。

1.6 参考书目

  • 《统计自然语言处理》 作者:宗成庆,清华大学出版社;
  • 《自然语言处理综论》 作者:冯志伟、孙乐,电子工业出版社。
    本文来源:图灵汇
责任编辑: : VR动态
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言人工智能处理笔记
    下一篇