最常见的应用场景之一是垃圾邮件拦截。
从句子中识别实体,例如提取人名、时间、地址等信息。
信息提取是指识别句子中的关键信息。与实体识别不同,信息提取抽取的是信息,而非具体的实体。例如,一条与收支相关的短信,需要提取出短信的具体内容,是入账、支出还是仅仅提醒还款(并未发生交易)。而提取短信中的金额、银行卡尾号等信息则属于实体识别。
错词识别与语法纠错功能常见于文字处理软件,如Word和WPS,以及各种开发工具。
依存分析是指分析句子中词语或实体之间的关系。例如,在一段与犯罪有关的文本描述中,识别谁是受害者,谁是嫌疑人。
文本评分包括自动评估文章的色情程度、判断文章与特定用户的匹配度,以及检测论文抄袭等。
自动摘要提取是根据文章内容自动生成文章摘要的功能。
机器翻译是将一种语言转换成另一种语言的过程,例如谷歌翻译、百度翻译和有道词典等都属于这一类。
词语联想最常见于搜索引擎,用户在输入部分词语时,系统会给出相关提示,如用户输入“自然”,会提示“自然语言处理”。
分词功能通常通过字典树和维特比算法实现,将句子合理地分割,便于后续的各种分析。
共指消解是指将文章中对同一实体的不同表述统一为同一描述。例如,“中国的首都被河北环绕,最初名字为北平,后来改为北京”,需要将中国的首都、北平、北京这三个词语统一为一个实体。
实体链接是指将文本中的实体与知识库中的相应实体链接起来,从而获取更多相关信息。这种技术常用于搜索系统,例如搜索中国的首都时,系统会显示与北京相关的词条。
文本相似度分析可以应用于文本聚类和论文查重等领域。
文本生成包括对话机器人、对联生成器、根据指定词语创作藏头诗等应用。