Facebook 自然语言处理新突破:新模型能力赶超人类 & 超难 NLP 新基准
作者头像
  • 石娜娜
  • 2022-06-24 13:41:50 16

自然语言处理的新进展:SuperGLUE基准

自然语言理解(NLU)和语言翻译在许多关键应用中发挥着重要作用,包括有害内容的识别和删除,以及促进全球不同语言用户之间的交流。虽然基于深度学习的方法在近年来显著提升了语言处理的能力,但在处理缺乏大量标注数据的任务时,现有的系统仍面临局限性。

因此,Facebook联合Deepmind Technologies、纽约大学(NYU)和华盛顿大学(UW)共同开发了SuperGLUE基准,进一步推动了自然语言处理领域的研究。

SuperGLUE基准的背景

Facebook在自然语言处理(NLP)领域取得了重大进展。通过半监督和自监督学习技术,Facebook成功利用未标记的数据提升系统性能。在第四届机器翻译大会(WMT19)上,Facebook采用了一种新的半监督训练方法,在多种语言翻译任务中取得优异成绩。此外,Facebook还引入了RoBERTa,这是一种自我监督的预训练方法,其在一些语言理解任务上超过了所有现有的NLU系统。

随着NLU系统发展迅速,现有的基准已无法满足需求。为了推动技术进步,Facebook与合作伙伴共同开发了SuperGLUE基准,这是一套全新的基准、排行榜和PyTorch工具包。

翻译准确性的突破

神经机器翻译(NMT)模型通常需要大量附有参考翻译的句子进行监督式训练。然而,高质量的双语数据并非总是可用。为此,Facebook采用反向翻译技术来克服这一问题。反向翻译是一种半监督学习技术,允许Facebook在一定程度上弥补数据不足的问题。

Facebook在WMT19比赛中提交的报告展示了其反向翻译系统的最新改进。该系统通过生成多个候选翻译,并选择最能平衡正向、反向和流畅性三种不同模型分数的翻译,从而进一步优化翻译效果。正向模型的分数主要取决于候选翻译在多大程度上捕捉了原句的意思;反向模型的分数则通过查看模型能否从候选翻译中重建出准确的句子来评判;流畅性模型的分数则根据候选翻译的流畅性来衡量。最终,系统通过对这三个分数的平衡,生成了显著优化后的翻译结果。

经过几年的努力,Facebook将英德翻译任务的性能提高了4.5个BLEU分值,这是一个显著的改进。根据人工评估,Facebook的模型在多个翻译任务中排名第一,甚至在某些情况下超过了人工翻译的质量。

自监督预训练方法的改进

Facebook在NLP领域的一项重要突破是BERT。Google在2018年发布的BERT展示了自监督训练技术的巨大潜力。Facebook利用BERT及其相关方法推动对话型人工智能研究,改进内容理解系统,并提高低资源和无监督翻译的质量。

Facebook对BERT进行了优化,引入了RoBERTa。RoBERTa修改了BERT中的关键超参数,包括删除BERT的下一个句子预训练目标,并使用更大的批量和学习率进行训练。与BERT相比,RoBERTa的数据总量增加了十倍,因此训练时间也更长。这种方法在广泛使用的NLP基准测试中取得了最先进的结果。

NLP研究的下一个前沿

作为衡量研究进展的标准,GLUE旨在涵盖广泛的NLP任务。目前的模型已经能够在GLUE基准测试中超过人类水平。为了进一步挑战NLP研究,Facebook人工智能团队与合作伙伴共同开发了SuperGLUE,这是一个具有全面人类基线的更高难度基准。

SuperGLUE包含了一系列具有挑战性的NLP任务,包括选择合理的替代方案(COPA)、因果推理任务等。这些任务旨在测试机器学习的核心领域,如样本有效性、转移、多任务和自监督学习。SuperGLUE还包括一些独特前沿组件,如Winogender,用于检测模型中的偏差。

下一步计划

为了进一步推动人工智能系统的发展,Facebook引入了第一个长格式问答数据集和基准测试,要求机器提供长而复杂的答案。此外,Facebook还成立了人工智能语言研究联盟(AILRC),旨在促进NLP领域的研究和发展。

通过这些努力,Facebook希望能够推动NLP领域的持续进步,促进全球范围内不同语言用户的交流和理解。

    本文来源:图灵汇
责任编辑: : 石娜娜
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言赶超基准ampFacebook模型人类突破能力处理
    下一篇