谷歌全新轻量级新模型ALBERT刷新三大NLP基准
作者头像
  • 白雪说
  • 2019-09-30 06:28:10 13

新模型ALBERT:参数更少,性能更强

ICLR 2020共收到了2594篇论文投稿,比去年增加了近1000篇。其中,来自谷歌的一篇论文尤为引人注目。该论文介绍了一种名为ALBERT的模型,其参数量比BERT-large更少,但在GLUE、RACE和SQuAD三个NLP基准测试中均取得了优异成绩。

ICLR(国际学习表征会议)由图灵奖得主Yoshua Bengio和Yann LeCun共同创办,被认为是深度学习领域的顶尖会议之一。ICLR 2019共收到了1591篇论文投稿,其中包括24篇oral论文和476篇poster论文。而在ICLR 2020,到9月25日论文提交截止日期,投稿数量达到了2594篇。

在这众多投稿中,一篇来自谷歌的论文引起了广泛关注。该论文提出了一种名为ALBERT的模型,参数量更少,但性能更佳。ALBERT在SQuAD 2.0和GLUE基准测试中均获得了最佳成绩,超越了BERT-large。

ALBERT,即A Lite BERT,是一个轻量级的BERT模型。虽然增加模型大小通常能提高性能,但在某些情况下,这会导致GPU/TPU内存限制、训练时间延长等问题。为解决这些问题,谷歌的研究团队提出了两种参数约简技术,以减少内存消耗,加快训练速度。

具体而言,ALBERT采用了两项关键技术:一是对嵌入参数化进行因式分解,即将大的词汇表嵌入矩阵分解为两个较小的矩阵;二是跨层参数共享,以避免参数随网络深度增加而增加。

通过这些技术,ALBERT在不显著影响性能的情况下大幅减少了参数数量,从而提高了参数效率。ALBERT的配置类似于BERT-large,但参数量减少了18倍,训练速度提高了1.7倍。此外,研究团队还引入了一种自监督损失函数,以提高句子顺序预测的准确性,从而改进了原始BERT模型中的NSP损失。

最终,ALBERT在GLUE、SQuAD和RACE三大基准测试中取得了新的SOTA结果。具体而言,ALBERT在RACE上的准确率达到了89.4%,在GLUE上的得分达到了89.4,在SQuAD 2.0上的F1得分达到了92.2。

这一成果表明,ALBERT不仅在参数效率方面表现出色,还在实际应用中展现了强大的性能。通过这些创新技术,ALBERT有望在未来推动自然语言处理领域的发展。

相关论文链接:https://openreview.net/pdf?id=H1eA7AEtvS

    本文来源:图灵汇
责任编辑: : 白雪说
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
轻量级基准模型刷新三大全新ALBERT谷歌NLP
    下一篇