「自然言语处理」运用自然言语处理的智能文档分析
作者头像
  • 中国音乐财经网
  • 2020-08-25 21:49:10 6

智能文档分析是什么?

智能文档分析(Intelligent Document Analysis, IDA)利用自然语言处理(NLP)和机器学习技术,从非结构化数据(如文本文档、社交媒体帖子、邮件、图像等)中提取有价值的信息。由于80%的企业数据是非结构化的,因此IDA能够在各个行业和业务领域带来实际的好处,比如提升合规性和风险管理、优化外部运营效率及增强业务流程。

在本文中,我们将探讨IDA中使用的几种关键技术,并举例说明这些技术在不同业务场景中的应用。此外,我们还会讨论启动IDA项目的几个关键考虑因素。

智能文档分析技术

以下是七种常见的IDA技术,每个技术都会通过具体示例加以解释。

1. 命名实体识别

命名实体识别(NER)是在文本中识别并分类特定实体,如人名、组织、职位、时间表达式、货币值等。实现NER的方法有多种:

  • 开箱即用的实体识别:大多数NLP工具或服务都配备了预先训练好的机器学习模型,可以轻松识别常用实体类型,如人名、组织和职位。
  • 机器学习实体识别:虽然开箱即用的实体识别方便,但它们往往较为通用,无法满足特定需求。例如,招聘文档可能需要识别职位和技能,而零售文档可能需要识别产品名称。
  • 确定性实体识别:如果要识别的实体有限且预定义,采用确定性方法比训练机器学习模型更为简便准确。这种方法通过字典来识别实体。例如,字典可以列出公司所有产品。
  • 基于规则的实体识别:如果实体可以用正则表达式定义,可以通过匹配正则表达式来识别。例如,可以使用正则表达式识别产品代码或引用。

命名实体识别是许多其他IDA技术的重要预处理步骤。例如,在财务报告中,公司和基金的名称可以通过开箱即用的模型识别,而基金名称则可以通过机器学习模型、确定性方法或两者结合来识别。

2. 情感分析

情感分析用于识别和分类文本中的情绪,如新闻报道、社交媒体内容和用户反馈。情感分析可以简单地分为积极和消极两类,但也可以细化到更细致的级别,如非常负面、负面、中性、积极和非常积极。情感分析需处理语言的复杂性,包括否定、层次情感、冲突、委婉语和俚语等。此外,实体级别的情感分析能够更精确地识别情感,例如,将“第一张专辑很棒,但第二张专辑是垃圾”分解为对两个专辑的不同情感评价。

情感分析常用于监测社交媒体上与公司及其竞争对手相关的情绪趋势,帮助跟踪事件影响、识别关键意见领袖并提前预警潜在危机。

3. 文本相似度

文本相似度用于计算句子、段落和文档之间的相似性。为了计算相似度,文本需先转换成表示文本的向量。向量可以包含文档中的关键词、实体或表示主题的内容。向量间的相似性可通过余弦相似度等技术测量。文本相似度可用于检测文档中的重复内容或近似重复内容。例如,可以通过比较学术论文的内容来检查抄袭情况,或将求职者与工作岗位匹配。

4. 文本分类

文本分类用于根据文本内容将文本项归类到一个或多个类别。文本分类可分为两类: - 分类数量:最简单的分类方式是二值分类,即只有两种可能的类别。例如,垃圾邮件过滤系统将邮件分为垃圾邮件或非垃圾邮件。多类分类允许文本被归类到两个以上类别。 - 标签数量:单标签分类将文本准确地归类为一个类别,而多标签分类则允许文本被归类为多个类别。例如,新闻文章可以被归类到多个主题区域。

文本分类依赖于文档中的单词、实体和短语来预测类别,还可以考虑标题、元数据或图像等其他特征。文本分类的一个常见应用场景是自动路由文档,将文档发送到适当的处理团队,从而节省时间和资源。

5. 信息抽取

信息抽取是从非结构化文本中提取结构化信息。例如,识别信件的发件人。主要手段包括参考材料、身份证明或会员编号。如果没有找到,可以使用发件人的姓名、邮政编码和出生日期。每条信息都可以通过命名实体识别来识别,但仅靠此还不够,因为可能会找到多个实例。信息抽取依赖于实体识别,并借助对实体上下文的理解来确定正确的答案。

6. 关系抽取

关系抽取用于提取两个或多个实体之间的语义关系。关系抽取依赖于命名实体识别,但重点在于识别实体之间的关系类型。例如,从非结构化医学文档中提取疾病、症状和药物之间的关系。一些NLP工具和服务提供了开箱即用的模型来提取关系,如“员工”、“结婚”和“出生地点”。关系抽取可用于填充知识图,从而更好地理解和利用非结构化文档中的信息。

7. 文本摘要

文本摘要用于创建文档的主要观点的简洁版本。有两种不同的方法: - 基于提取的摘要:在不修改原文的情况下提取句子或短语。这种方法生成由文档中最重要的N个句子组成的摘要。 - 基于生成的摘要:使用自然语言生成技术重写和压缩文档。与基于提取的方法相比,这种方法更为复杂和实验性。

文本摘要使读者能够快速消化大量文档的内容,而无需完全阅读。例如,新闻推送或科学出版物常常生成大量文档,这些文档适合通过摘要来呈现。

智能文档分析的复杂性

机器学习在非结构化文本上的应用比在结构化数据上更为复杂,因此要达到甚至超过人类水平的文档分析能力非常困难。IDA技术必须能够处理语言的变化、歧义、语境和关系,从而获得准确的洞察。处理特定领域的术语和结合通用语言与特定领域的术语是IDA面临的挑战之一。解决这些问题的一种方法是迁移学习,即利用已经训练好的通用文本模型,再添加特定任务的数据进行微调。

IDA技术的准确性受多种因素影响,包括训练数据的质量、类别数量、文档大小等。评估IDA准确性的最佳方式是问自己“人类完成这项任务有多容易?”如果一项任务一个人在不需要多年培训的情况下就能准确完成,那么IDA有可能通过加速过程、保持一致性或减少体力劳动来带来益处。

如何启动智能文档分析项目

IDA项目可以通过两种主要方式集成到企业中: - 自动化:IDA用于自动化现有或新流程,无需人工干预。 - 人在回路:IDA用于辅助人类决策,但最终责任仍由人类承担。

选择哪种方法应根据IDA的准确性和错误决策的成本来决定。如果错误决策成本较高,建议从人在回路开始,直到准确度足够高为止。IDA项目最好以迭代方式进行,从概念验证开始,确定方法是否可行以及准确度是否足以实现自动化或人在回路。随后逐步增加复杂性,直至预计的工作量无法证明预期收益。

对于您的第一个IDA项目,建议: - 选择一个错误决策成本较低的用例,或由人类最终决策的用例; - 从概念验证开始,确定方法是否可行; - 迭代增加复杂性,提高应用程序的准确性。

通过谨慎规划和实施策略,您的组织可以利用本文讨论的NLP和机器学习技术,开发出能够改善业务成果的IDA应用。

    本文来源:图灵汇
责任编辑: : 中国音乐财经网
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
言语自然处理运用文档智能分析
    下一篇