四两拨千斤,如何做到自然言语预训练加速十倍
作者头像
  • 2021-01-19 18:43:30 5

降低预训练成本与提高效率的新方法

近年来,自然语言处理中的预训练技术备受关注,特别是像GPT-3这样的大规模模型更是引起了广泛关注。然而,训练这些大型模型需要大量的计算资源,即使是训练简单的BERT模型也需要多个GPU运行1至2周的时间,这不仅消耗高昂的电费,而且购买GPU的费用也非常昂贵。这种高成本的门槛使得许多研究者难以涉足这一领域。

为了降低预训练的门槛,微软亚洲研究院的研究团队从多个角度出发,提出了一系列优化方法。这些方法不仅可以单独使用,还可以结合在一起,从而显著提高训练效率。例如,原本需要10天的训练现在只需要一天就能完成。

基于Transformer的新结构TUPE

在预训练模型中,位置嵌入(Positional Embedding)是一种常用的技术,但在实际应用中,这种方法是否真正有效一直存在争议。微软亚洲研究院的研究人员提出了一种名为TUPE(Transformer with Untied Positional Encoding)的新结构,旨在解决这些问题。

传统的Transformer模型无法区分来自不同位置的词语,因此需要借助位置嵌入来辅助。然而,位置嵌入本身不具备语义信息,与词向量相加可能会使模型更难学习。研究人员通过调整Transformer的注意力机制,消除了位置与文本之间的交叉,并使用不同的变换矩阵,从而提高了模型的学习效率。实验结果表明,TUPE不仅优于基线模型,而且在训练早期就能达到基线模型在后期才能达到的效果。

高效数据应用:让BERT像人类一样记笔记

在语言数据集中,许多单词的出现频率非常低,导致这些单词的词向量质量较差,影响了模型的整体性能。微软亚洲研究院的研究人员提出了一种名为TNF(Taking Notes on the Fly)的方法,通过动态记录低频词的历史上下文信息,使模型能够更好地理解这些低频词。这种方法显著提高了训练效率,使得在相同训练次数下,TNF的训练时间仅为基线模型的40%。

合理的预训练任务:从ABC单选题开始

目前,许多预训练模型采用的是掩码语言模型任务,即遮住一部分输入句子,让模型预测被遮住的部分。然而,这种任务的实际难度非常高,尤其是当备选项是整个词典时。微软亚洲研究院的研究人员提出了一种新的预训练任务,即设计ABCD单选题,以简化任务难度。通过自适应调整单选题的难度,模型可以在早期快速学习基础知识,而在后期逐步增加任务难度,从而实现更精细的学习效果。这种方法的应用使得训练速度提升了80%,大大降低了计算成本。

通过以上方法,研究人员成功地降低了预训练的成本与计算代价,使得更多研究者可以参与到这一领域中来。这些创新不仅提高了训练效率,也为未来的研究提供了新的思路。

    本文来源:图灵汇
责任编辑: :
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
四两拨千斤言语做到加速训练自然如何
    下一篇