近日,科技巨头谷歌和微软在一项重要的自然语言理解榜单中取得了超越人类的成绩。微软表示,这一突破标志着通往通用人工智能的重要一步。
自然语言理解(Natural Language Understanding, NLU)一直是人工智能领域的一个重要课题,被誉为“人工智能皇冠上的明珠”。由于自然语言本身的复杂性和多义性,实现高质量的自然语言理解具有很高的挑战性。
为了评估人工智能模型在自然语言理解方面的表现,纽约大学、华盛顿大学、Facebook和DeepMind于2019年联合推出了SuperGLUE基准测试。SuperGLUE是从2018年的GLUE测试发展而来的,它包含了一系列更为复杂的自然语言理解任务,如问答、自然语言推理、指代消解和词义消歧等。
SuperGLUE榜单显示,在最新的测试中,微软的DeBERTa模型和谷歌的T5+Meena模型分别占据了第一和第二的位置,均超过了人类基准线。这是人工智能首次在SuperGLUE测试中超越人类水平。
尽管在SuperGLUE测试中取得了令人满意的成绩,微软承认DeBERTa模型还未达到人类在自然语言理解上的水平。人类擅长利用从不同任务中学到的知识解决新问题,这是目前AI模型需要进一步学习的方向。
DeBERTa模型拥有15亿个参数,在SuperGLUE测试中的宏观平均分为89.9,超过了人类的89.8分;整体得分为90.3,同样超越了人类基准线。排名第二的T5+Meena模型得分90.2,也超过了人类基准线。
SuperGLUE测试中的人工智能模型需要回答一些复杂的因果推理问题。例如,“这个孩子对疾病产生了免疫力”,问题是“这是由什么导致的?”选项包括:“他避免接触这种疾病”或“他接种了这种疾病的疫苗”。虽然这个问题对于人类来说相对简单,但对于AI模型来说却是一项挑战,因为它们需要理解已知条件和选项间的因果关系。
2021年1月6日,微软在其博客上详细介绍了DeBERTa模型。DeBERTa是一种基于Transformer架构的神经语言模型,采用了自监督学习方法对大量原始文本数据进行预训练。DeBERTa旨在学习通用的语言表达方式,适用于各种自然语言理解任务。该模型运用了三种关键技术:分离注意力机制、增强的掩码解码器和虚拟对抗训练方法。
谷歌的T5+Meena模型则来自其团队,尽管具体细节尚未公布,但微软指出,谷歌的T5模型包含110亿个参数,相比之下,DeBERTa模型在训练和维护上更加节能,更容易压缩和部署到各种应用程序中。
微软计划将DeBERTa模型整合到下一代“图灵自然语言生成模型”(Turing NLRv4)中,并准备在未来公开15亿参数的DeBERTa模型及其源代码。