自然言语处理11种静态图构建方法,用于知识图谱及文本处理
作者头像
  • 电力AI论坛
  • 2021-06-26 11:21:28 11

静态图构建方法的目标是在预处理阶段构建图结构,通常利用现有的关系解析工具(如依存分析)或手动定义的规则。静态图包含隐藏在原始文本中的不同范畴和外部知识,通过丰富的结构化信息增强文本内容。以下是11种静态图的构建方法:

1. 依赖图构建

依赖图广泛应用于捕捉句子中不同对象间的依赖关系。通过运用各种自然语言处理(NLP)工具(如Stanford CoreNLP)获取依存分析树(如句法依存树或语义依存关系树)。然后,从依存分析树中提取依赖关系,并将其转换为依赖图。为了保留顺序信息,可以在图结构中引入顺序链接。依赖图构建的关键步骤包括构建依赖关系、构建顺序关系,最后完成图的转换。

2. 成分图构建

成分图用于捕捉一个或多个句子中基于短语的句法关系。与依存分析不同,成分分析不仅关注单词之间的关系,还考虑短语级别的关系。成分图的例子如图2所示。在成分图中,所有节点都有相同的类型,且区分终端节点和非终端节点。对于相邻的每个单词节点对,在它们之间添加一条具有特定序列类型的无向边,以保留顺序信息。

3. 抽象语义表示图构建

抽象语义表示图(AMR图)是一种有根、有标注、有向、无环的图,用于表示自然文本中抽象概念间的高级语义关系。AMR图不同于句法结构,它提供了一种高层次的语义抽象。例如,“保罗描画自己是一个战士”和“保罗对他的描述:一个战士”可以共享相同的AMR解析结果。AMR图由AMR解析树衍生而来。

4. 信息抽取图构建

信息抽取图(IE图)旨在从自然句子中提取结构信息,以表示高级信息,如基于文本的文档。构建IE图的过程包括三个基本步骤:指代消解、构建IE关系、构建图。

5. 话语图构建

话语图用于描述句子间的逻辑联系,以解决长距离依赖问题。在处理较长文档时,话语图可以有效应对挑战。

6. 知识图谱构建

知识图谱(KG)用于捕捉实体和关系,从而促进NLP任务中的学习和推理。KG可以表示为G(V, E),通常由知识库中的元素构建。构建KG的第一步是获取给定查询中的术语实例,然后通过匹配算法将术语实例与KG中的概念关联起来。下一步是获取初始节点的1跳邻居,并计算邻居与初始节点的相关性。根据相关性分数修剪边,去除孤立的邻居,最终子图被用来提供信息。

7. 共指图构建

共指图用于显式建模隐性共指关系,当某个段落中的多个术语指向同一对象时,共指图可以连接这些术语。这种方法有助于更好地理解语料库的复杂结构和逻辑。

8. 相似性图构建

相似性图用于量化节点间的相似性,在许多NLP任务中广泛应用。相似性图的构建通常在预处理过程中进行,而不是与其他学习系统共同训练。图6展示了一个相似性图的例子。

9. 共现图构建

共现图用于捕捉文本中词语间的共现关系,这是许多NLP任务的重要特征。共现图的例子见图7。

10. 主题图构建

主题图用于捕捉文档间不同主题的高层次语义关系。构建主题图通常需要先用一些主题建模算法(如LDA)学习潜在的主题,然后在文档节点和主题节点之间构建无向边。

11. 应用驱动图构建

应用驱动图是为特定NLP任务专门设计的图。例如,SQL语言可以通过SQL解析树来表示,进而转换为SQL图。这类图通常过于专业化,没有统一的构建形式。图9展示了这种应用驱动图的一个例子。

以上是11种静态图的构建方法,每种方法都适用于不同的应用场景和需求。

    本文来源:图灵汇
责任编辑: : 电力AI论坛
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
处理图谱静态构建言语文本用于自然方法知识
    下一篇