近日,阿里AI在常识问答领域的重要数据集CommonsenseQA上刷新了世界纪录,超越微软成为第一,显著提升了AI的常识推理能力。这项成就由“95后”实习生叶志秀在达摩院科学家的指导下完成。
CommonsenseQA是一个专门用于测试基于常识知识的问答能力的数据集,相比之前更为复杂的SWAG、SQuAD数据集,它更具挑战性。目前流行的BERT模型在SWAG、SQuAD上表现接近或超过人类水平,但在CommonsenseQA上的准确率仍远远落后于人类。
自然语言处理(NLP)是人工智能的重要领域,其中常识推理是最具挑战性的任务之一。在机器翻译、阅读理解等领域,AI的表现已接近或超越人类水平,阿里AI也在国际顶级赛事如WMT、SQuAD、MS MARCO等比赛中取得了优异成绩。然而,在常识推理方面,AI的表现远不及人类。常识包括大多数人熟知的基本事实,例如盐是咸的、下雨时要打伞等。人类在解答问题时,常常依靠这些不言而喻的背景知识,而机器则缺乏这种常识。
深度学习专家、图灵奖得主Yann LeCun曾指出,即便是最先进的AI系统,在常识方面也比不上一只猫。在包含1.2万多个常识问题的CommonsenseQA数据集中,最流行的AI模型BERT的准确率仅为56.7%,远低于人类的89%。
阿里巴巴达摩院的语音实验室开发了一种名为AMS的方法,显著提升了BERT模型的常识推理能力。这种方法在不增加计算量的前提下,将CommonsenseQA数据集上的准确率提高了5.5%,达到了62.2%。
这一技术进步将大幅提高未来人机交互产品的常识理解能力,应用范围广泛,包括语音导航、智能电视、语音售票机等。例如,当用户驾车前往一个已经搬迁的村庄时,即使导航系统尚未更新位置信息,具备常识的AI系统也能避免引导用户驶向错误的方向。
达摩院计划在未来开源该模型和论文,与行业共享最新研究成果。
以上是经过改写的内容,确保了与原文的核心信息一致,同时在语言风格和表达方式上有所区别。