近日,科技巨头谷歌和微软在一项权威的自然语言理解榜单中取得了超越人类的表现。微软称这“标志着迈向通用人工智能的重要里程碑”。
自然语言理解(NLU)任务在人工智能领域有着悠久的历史,被誉为“人工智能皇冠上的明珠”。由于自然语言本身的多义性和模糊性,实现高质量的自然语言理解具有相当的挑战性。
为了评估人工智能模型的自然语言理解能力,纽约大学、华盛顿大学、Facebook和DeepMind在2019年共同推出了一项名为SuperGLUE的人工智能基准测试。SuperGLUE源自2018年的GLUE,它包含更多复杂任务,如问答、自然语言推理、指代消解和词义消歧等。
SuperGLUE榜单显示,在最新的SuperGLUE测试中,微软的DeBERTa模型和谷歌的T5+Meena模型分别位列第一和第二,均超过了人类基准线。这是人工智能首次在SuperGLUE测试中超越人类水平。
尽管在SuperGLUE测试中取得了令人满意的成绩,微软承认DeBERTa模型尚未达到人类在自然语言理解方面的水平。人类能够灵活运用从不同任务中学到的知识解决新问题,这是当前AI模型需要进一步学习的方向。
排名第一的微软模型DeBERTa拥有15亿个参数。在SuperGLUE测试中,单个DeBERTa模型的宏观平均分(89.9分)略高于人类表现(89.8分);整体得分(90.3分)同样超过人类基准线(89.8分)。排名第二的T5+Meena模型得分为90.2,也超过了人类基准线(89.8分)。
在SuperGLUE测试中,人工智能模型需要回答类似这样的问题:“已知‘这个孩子对疾病产生了免疫力’,问‘这是由什么导致的?’请选择:A. ‘他避免接触这种疾病’;或B. ‘他接种了这一疾病的疫苗’。”这是一个简单的因果推理任务,人类容易选出正确答案,但对于人工智能模型来说,却是一个挑战。为了得出正确答案,模型需要理解已知条件和选项之间的因果关系。
2021年1月6日,微软在其官方博客中详细介绍了获得榜首的DeBERTa模型。
DeBERTa全称为“解耦注意力增强型BERT”,是一种基于Transformer架构的神经语言模型,采用自监督学习方法对大量原始文本语料库进行预训练。DeBERTa旨在学习通用的语言表达方式,适用于各种自然语言理解任务。它主要采用了三种新技术:解耦注意力机制、增强的掩码解码器以及用于微调的虚拟对抗训练方法。
排名第二的T5+Meena技术来自谷歌。尽管谷歌尚未详细解释其模型在SuperGLUE测试中的优异表现,但微软在博客文章中提到,谷歌的T5模型由110亿个参数组成,相比之下,15亿参数的DeBERTa在训练和维护上更加节能,更容易压缩并部署到各种应用程序中。
微软计划将DeBERTa模型集成到下一代“图灵自然语言生成模型”(Turing NLRv4)中,并准备向公众开放15亿参数的DeBERTa模型及其源代码。