自然言语处理中自留意力机制(Self-Attention)的基本知识
作者头像
  • 财富管理中心mp
  • 2020-07-03 15:51:21 2

引言

Transformers 是一种在机器学习(ML)领域中备受关注的新型架构,尤其在自然语言处理(NLP)任务中表现突出。这些模型特别适用于序列到序列(seq2seq)的任务,例如机器翻译和文本生成。自2017年首次发布以来,Transformers 已经取代了循环神经网络(RNN)中的长短期记忆单元(LSTM),成为 NLP 应用的主要架构之一。无论是学术研究还是行业应用,Transformers 都扮演着重要角色。

Self-Attention 的工作原理

Transformers 最核心的部分是其内部的 Self-Attention 机制。Self-Attention 能够捕捉单词间的关联性,使模型能够理解句子中的上下文关系。简单来说,Self-Attention 将输入向量转换为一个新的向量序列,其中每个新向量不仅包含了原始单词的信息,还包含了该单词与其他单词的关系。

Self-Attention 的数学表示

为了实现这一目标,我们需要一个系统来学习单词间的重要关系,类似于人类理解句子的方式。例如,在句子“The animal crossed the street”中,“the”和“animal”之间存在某种关联。Self-Attention 通过计算单词间的相似性来实现这一点。

假设我们有一个包含三个单词的输入序列:x1, x2, x3。每个单词都被表示为一个向量。为了将这些向量转换为新的向量序列 z,我们需要计算每个输入向量与其他向量之间的关系。

首先,我们将每个输入向量与序列中的所有其他向量进行点积运算。点积的结果反映了两个向量之间的相似性。接下来,为了使这些结果更具可解释性,我们使用 softmax 函数对其进行归一化处理。这样可以确保每个权重值都在 0 到 1 之间,并且所有权重的总和为 1。

最终,我们将归一化的权重应用于原始输入向量,并将它们相加。这样我们就得到了一个新的向量,这个向量不仅包含了原始单词的信息,还包含了该单词与其他单词的关系。

自注意力的应用场景

这种机制使得模型能够灵活地捕捉不同单词之间的关系。例如,在句子“The cat sat on the mat”中,虽然“the”、“cat”和“mat”之间没有直接的相似性,但通过 Self-Attention,模型仍然能够识别它们之间的联系,从而更好地理解整个句子的意义。

结论

Self-Attention 机制是 Transformers 架构的核心,使模型能够理解单词间的复杂关系。通过计算和归一化向量之间的相似性,Self-Attention 能够生成更加丰富的向量表示,从而提高模型在 NLP 任务中的性能。

参考文献

  1. Alammar J. The Illustrated Transformer. (2018) https://jalammar.github.io/illustrated-transformer/
  2. Bloem P. Transformers from Scratch. (2019) http://www.peterbloem.nl/blog/transformers
  3. Vaswani A. et al. Dec 2017. Attention is all you need. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA. https://papers.nips.cc/paper/7181-attention-is-all-you-need.pdf
  4. Vaswani A. et al. Mar 2018 arXiv:1803.07416

希望以上内容能够满足您的需求。如果有任何进一步的要求,请随时告诉我。

    本文来源:图灵汇
责任编辑: : 财富管理中心mp
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
基本知识Attention留意言语机制自然处理Self
    下一篇