Google 开源最新 NLP 模型,能处理整本《罪与罚》
作者头像
  • aircraft观察
  • 2020-07-19 12:06:49 3

近年来,NLP(自然语言处理)领域涌现出了不少引人瞩目的模型,其中Transformer无疑是关注度较高的一个。

2017年,Google发表了名为“Attention Is All You Need”的论文,首次提出了完全基于注意力机制的网络框架Transformer。到了2018年,Google开源了基于Transformer的BERT模型,迅速在NLP领域走红。

2019年,基于Transformer的自然语言模型成为机器学习领域的一大趋势。这些模型在功能上不断取得突破,表现出色。2020年,根据自然语言处理领域著名的GLUE数据集排名,表现最好的一些模型,如Nvidia的Megatron、Google的XLNet、微软的MT-DNN和Facebook的Roberta,均采用了Transformer架构。

最近,Google又推出了一款升级版的Transformer模型——Reformer,旨在提升模型的效率。

对于人工智能和机器学习模型而言,无论是处理文本、音乐、语音还是视频,理解序列数据都是一个挑战。特别是在广泛的应用场景下,比如在视频中消失很久的物体重新出现时,很多算法可能会忘记其特征。为此,Google开发了Transformer模型,旨在解决这些问题。Transformer是一个可以扩展到数千个单词的架构,极大地提升了模型在作曲、图像合成、逐句文本翻译和文档摘要等方面的功能。

尽管Transformer在很多方面表现出色,但在面对更大规模的数据时仍存在局限性。具体来说,大窗口应用程序需要的内存容量巨大,导致模型只能处理少量文本或生成较短的音乐片段。基于此,Google推出了Reformer,作为Transformer的升级版。Reformer可以在单个AI加速器芯片上运行,并且只需要16GB的存储器,就可以处理多达100万个单词的环境。

据了解,相关论文《Reformer: The Efficient Transformer》已被ICLR-2020会议接收,并已开源。Reformer主要包含以下技术特点:

首先,可逆层在整个模型中只存储激活函数的一个副本,从而大大减少了内存占用;

其次,在前馈层内部对激活函数进行拆分,并采用分段处理,进一步节省了内存;

最后,利用局部敏感哈希(LSH)算法,这种算法可以将任意大小的数据映射到固定大小的值,匹配相似的向量,而不是在所有可能的向量对中搜索。在翻译任务中,这种方法可以大大提高处理速度和效率。

为了验证Reformer在单个GPU上的性能以及其在长序列任务中的训练速度,研究人员在enwik8和imagenet64数据集上对20层的Reformer模型进行了测试。实验表明,Reformer不仅达到了与Transformer相同的功能,而且在内存使用效率和长序列任务训练速度方面表现更加出色。

此外,研究团队还尝试了基于Reformer的图像和文本模型,用于生成图像中缺失的细节,甚至处理了长达211,591个单词的小说《罪与罚》。研究表明,Reformer可以逐像素生成全帧图像,并在单轮训练中处理长篇文本。

Google科学家Łukasz Kaiser和加州大学伯克利分校的学生Nikita Kitaev指出,Reformer的高效率使得它可以直接应用于数据量远超现有最先进的文本模型的数据集。他们认为,Reformer在处理大规模数据集方面的潜力可能会激发社区创建更大规模的数据集。

目前,研究人员正计划将Reformer应用于更广泛的领域,如时间序列预测、音乐、图像和视频生成,并改进位置编码处理。他们相信,Reformer为未来使用Transformer模型处理长文本和自然语言处理之外的应用奠定了基础。

以上内容由VentureBeat报道,雷锋网编译。

    本文来源:图灵汇
责任编辑: : aircraft观察
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
开源模型处理Google最新NLP
    下一篇