自然言语处理在开放搜索中的运用
作者头像
  • 天成有我
  • 2020-10-15 14:48:40 7

自然语言处理在开放搜索中的应用

自然语言智能

自然语言智能旨在实现人与计算机之间的有效沟通。它融合了语言学、心理学、计算机科学、数学和统计学等多个领域的知识,涵盖了自然语言和形式化语言的分析、抽取、理解和生成等多方面课题。

人工智能的发展阶段

  • 计算智能:利用强大的计算能力和海量数据存储,某些领域可以超过人类表现。例如,AlphaGo依靠谷歌TPU的强大算力以及蒙特卡洛树搜索、强化学习等算法,在围棋中击败人类。
  • 感知智能:识别无结构化数据中的关键要素。例如,分析查询中的实体(人名、地名、机构名)。
  • 认知智能:在感知基础上进一步理解要素意义并进行推理。例如,“谢霆锋是谁的儿子”与“谁是谢霆锋的儿子”虽然词语相似,但语义不同,这需要认知智能来解决。
  • 创造智能:在理解语义的基础上,创造符合常识、语义和逻辑的句子。例如,自动写作小说、创作音乐、进行自然流畅的对话。

自然语言处理涵盖了感知智能、认知智能和创造智能,是实现完整人工智能的关键技术。

自然语言智能的发展趋势

  • 深度语言模型的突破性发展:引领自然语言技术的进步。
  • 公共云NLP服务从通用功能向定制化服务转变:更好地满足特定行业和场景需求。
  • 自然语言技术与行业/场景紧密结合:产生更大的实际价值。

阿里集团的NLP平台能力

阿里集团的NLP平台分为四个层次:NLP数据、NLP基础能力、NLP应用技术和高层应用。其中,NLP数据包括词汇表、实体知识词典、句法词典、情感分析词典等。基础技术涵盖词法分析、句法分析、文本分析和深度模型。在此之上,还包括问答、对话技术、垃圾过滤、地址解析等垂直技术。

开放搜索中的NLP应用和技术

开放搜索旨在提供一站式、开箱即用的智能搜索服务。其基础设施包括阿里云的基础产品和服务,如HA3、RTP、Dii等。管控基础平台负责数据采集、管理和训练。算法模块分为查询分析和相关性排序两个部分,其中查询分析涉及多粒度分词、实体识别和纠错改写等。

开放搜索中的NLP分析链路

当用户输入搜索关键词时,例如“aj1北卡兰新款球鞋”,开放搜索会启动一系列NLP分析。主要包括跨范畴分词、命名实体识别和拼写纠错等步骤。

  • 跨范畴分词:通过构建特定领域的词典和使用远程监督技术,快速生成定制化的分词模型,从而提升效率并满足客户需求。
  • 命名实体识别:采用融合BERT和知识图谱的GraphNer框架,在中文上取得最佳效果。
  • 拼写纠错:通过统计翻译模型和神经网络翻译模型的结合,提供高效的纠错步骤。

语义匹配

深度语言模型在语义匹配任务中取得了显著进展。达摩院提出的StructBert模型通过添加字序/词序目标函数和多样化的句子结构预测目标函数,实现了多任务学习。然而,通用的StructBert模型难以适用于开放搜索中的众多客户和领域,因此提出了三阶段的语义匹配范式,以便快速为客户定制适合其业务需求的模型。

NLP算法产品化

算法模块的产品化系统架构包括离线计算、在线引擎和产品控制台。用户可以直接在控制台上体验和使用开放搜索提供的NLP相关功能。

以上便是此次云栖大会关于“自然语言处理在开放搜索中的应用”的主要内容。如果您对搜索与推荐技术感兴趣,欢迎加入钉钉群内交流。

    本文来源:图灵汇
责任编辑: : 天成有我
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
言语运用自然开放处理搜索
    下一篇