自然语言智能研究旨在实现人与计算机之间的有效沟通。这一领域融合了语言学、心理学、计算机科学、数学和统计学等多个学科。它涵盖了自然语言和形式化语言的分析、提取、理解、转换和生成等多个方面。
人工智能可以分为以下几个阶段:
计算智能:依赖强大的计算能力和海量数据存储能力,能够在特定领域超越人类表现。例如,谷歌的AlphaGo通过利用谷歌TPU的强大算力以及蒙特卡洛树搜索和强化学习等算法,在围棋的巨大搜索空间中找到最佳决策路径,从而击败人类。
感知智能:从非结构化数据中识别重要元素。例如,通过查询分析,识别出其中的人名、地名和机构名等信息。
认知智能:在感知基础上,理解其中的含义并进行推理。例如,“谢霆锋是谁的儿子?谁是谢霆锋的儿子?”这两句话虽然词语相似,但语义差异很大。认知智能就是要解决这种问题。
创造智能:基于对语义的理解,创造出符合常识、语义和逻辑的句子。例如,自动创作流畅的小说、生动的音乐,以及自然流畅的对话。
自然语言处理研究涵盖了感知智能、认知智能和创造智能等领域,是实现完整人工智能的关键技术。
自然语言智能的发展趋势主要体现在以下几个方面:
阿里集团的NLP平台能力可以分为四个层次:NLP数据、NLP基础能力、NLP应用技术和顶层应用。
开放搜索中的NLP应用和关键技术主要包括以下几个方面:
开放搜索的目标是提供一站式、开箱即用的智能搜索服务,将这些算法能力以行业模板、场景化和服务化的方式提供给用户。
开放搜索通常由一个搜索关键词触发,例如用户搜索“aj1北卡蓝新款球鞋”。
我们开放了一系列领域的分词模型,以应对不同领域的分词需求。
通过这些技术,我们可以显著提高分词效果,更好地满足客户需求。
命名实体识别(NER)是从查询中提取人名、地名和时间等实体。
开放搜索中的拼写纠错分为四个步骤:挖掘、训练、评估和在线预测。主要采用统计翻译模型和神经网络翻译模型,并有一套完整的功能体系。
深度语言模型的出现极大地提升了自然语言处理任务的效果,特别是在语义匹配方面。达摩院提出了StructBert模型,通过添加字序/词序目标函数和多样化句子结构预测目标函数来增强多任务学习能力。然而,通用的StructBert无法适用于开放搜索中的数千个客户和数千个领域。因此,我们提出了一个三阶段范式,快速定制适合客户的语义匹配模型。
NLP算法的产品化系统架构包括离线计算、在线引擎和产品控制台。浅蓝色部分展示了开放搜索中提供的NLP相关功能,用户可以直接在控制台体验和使用。
本文内容来自阿里云,未经授权不得转载。