静态图构建方法的目标是在预处理阶段构建图结构,通常利用现有的关系解析工具(如依存分析)或手动定义的规则。静态图包含隐藏在原始文本中的不同范畴和外部知识,通过丰富的结构化信息增强文本内容。以下是11种静态图的构建方法:
依赖图广泛应用于捕捉句子中不同对象间的依赖关系。通过运用各种自然语言处理(NLP)工具(如Stanford CoreNLP)获取依存分析树(如句法依存树或语义依存关系树)。然后,从依存分析树中提取依赖关系,并将其转换为依赖图。为了保留顺序信息,可以在图结构中引入顺序链接。依赖图构建的关键步骤包括构建依赖关系、构建顺序关系,最后完成图的转换。
成分图用于捕捉一个或多个句子中基于短语的句法关系。与依存分析不同,成分分析不仅关注单词之间的关系,还考虑短语级别的关系。成分图的例子如图2所示。在成分图中,所有节点都有相同的类型,且区分终端节点和非终端节点。对于相邻的每个单词节点对,在它们之间添加一条具有特定序列类型的无向边,以保留顺序信息。
抽象语义表示图(AMR图)是一种有根、有标注、有向、无环的图,用于表示自然文本中抽象概念间的高级语义关系。AMR图不同于句法结构,它提供了一种高层次的语义抽象。例如,“保罗描画自己是一个战士”和“保罗对他的描述:一个战士”可以共享相同的AMR解析结果。AMR图由AMR解析树衍生而来。
信息抽取图(IE图)旨在从自然句子中提取结构信息,以表示高级信息,如基于文本的文档。构建IE图的过程包括三个基本步骤:指代消解、构建IE关系、构建图。
话语图用于描述句子间的逻辑联系,以解决长距离依赖问题。在处理较长文档时,话语图可以有效应对挑战。
知识图谱(KG)用于捕捉实体和关系,从而促进NLP任务中的学习和推理。KG可以表示为G(V, E),通常由知识库中的元素构建。构建KG的第一步是获取给定查询中的术语实例,然后通过匹配算法将术语实例与KG中的概念关联起来。下一步是获取初始节点的1跳邻居,并计算邻居与初始节点的相关性。根据相关性分数修剪边,去除孤立的邻居,最终子图被用来提供信息。
共指图用于显式建模隐性共指关系,当某个段落中的多个术语指向同一对象时,共指图可以连接这些术语。这种方法有助于更好地理解语料库的复杂结构和逻辑。
相似性图用于量化节点间的相似性,在许多NLP任务中广泛应用。相似性图的构建通常在预处理过程中进行,而不是与其他学习系统共同训练。图6展示了一个相似性图的例子。
共现图用于捕捉文本中词语间的共现关系,这是许多NLP任务的重要特征。共现图的例子见图7。
主题图用于捕捉文档间不同主题的高层次语义关系。构建主题图通常需要先用一些主题建模算法(如LDA)学习潜在的主题,然后在文档节点和主题节点之间构建无向边。
应用驱动图是为特定NLP任务专门设计的图。例如,SQL语言可以通过SQL解析树来表示,进而转换为SQL图。这类图通常过于专业化,没有统一的构建形式。图9展示了这种应用驱动图的一个例子。
以上是11种静态图的构建方法,每种方法都适用于不同的应用场景和需求。