2019年12月8日至14日,机器学习领域的重要国际会议——NeurIPS 2019在加拿大温哥华举行。这次大会吸引了超过一万名来自全球的专家学者参与。其中,自然语言处理(NLP)领域在深度学习的推动下取得了显著进展,成为大会的核心议题之一。
百度在此次大会上举办了自然语言处理专题研讨会,展示了其在该领域的深厚积累和最新突破。百度技术委员会主席兼自然语言处理首席科学家吴华博士及其团队,详细介绍了百度在这一领域的研究成果。这些成果主要基于百度自主研发的飞桨平台,涵盖了语义计算、阅读理解、多轮对话、机器翻译等方向,并已实现大规模产业化应用。
在预训练模型方面,百度提出了知识增强的语义表示模型ERNIE及持续学习语义理解框架ERNIE 2.0。这两种模型在16个中英文任务中均表现优异,超越了BERT和XLNET,达到了最先进水平(SOTA)。此外,百度还推出了基于ERNIE的语义理解开发套件,从原理、应用到开源及平台化,进行了有价值的创新和实践。
在机器阅读理解方面,百度建设并发布了最大的中文阅读理解数据集DuReader。该数据集旨在评估机器的语言理解能力,是搜索引擎和对话系统等行业的关键技术。百度还提出了训练框架D-NET,提升了模型的泛化能力,并提出了一种针对阅读理解的对抗训练方法。此外,百度还开发了融合文本表示和知识表示的KT-NET模型,解决了需要外部知识和常识的问题。这些模型在MRQA阅读理解评测中表现出色,夺得冠军。
在对话系统方面,百度提出了基于深度注意力网络的多轮响应选择匹配模型DAM,显著提高了口语理解能力。百度的对话系统框架提供了可编程的对话管理模块,并内置了多个常用的标准对话模板,便于云端开发灵活多变的业务对话逻辑。此外,百度还引入了需求分发和全局记忆机制,支持多个对话任务的集成与联动,提高了对话技能的可复用性,降低了新业务的开发成本。百度的定制对话技术依托于百度大脑UNIT 3.0平台,支持超过5万个对话技能,广泛应用于各行业。
在机器翻译领域,百度提出了多任务学习和多智能体联合训练等前沿方法,并在2019年国际权威评测WMT中取得了中英翻译的第一名。此外,百度在机器同声传译方面也处于领先地位,提出了首个具有预测和可控时延的同传模型,首个语义单元驱动的上下文同传模型,并研发了行业内首个语音到语音的同传系统,为用户提供高质量、低延迟的同传体验。百度还将与Google、Facebook、清华大学等国内外顶尖机构合作,共同组织首届机器同传研讨会,将在顶级会议ACL 2020上召开,并举办国际首届同传评测,以进一步促进技术的发展。
百度自然语言处理领域所取得的卓越成果离不开底层框架的支持。百度飞桨是一个开源的深度学习平台,近两年来,飞桨在深度学习框架的功能、性能、芯片支持等方面进行了大量的优化和迭代,为开发者提供了优秀的使用体验。飞桨平台不仅支持常用的API调用,还支持声明式编程和命令式编程两种编程范式,兼顾灵活性和稳定性。在训练方面,飞桨平台突破了超大规模深度学习模型的训练技术,实现了实时更新万亿规模参数的深度学习模型。
在论文方面,本届会议共收到6743篇论文投稿,两年内翻了一番,再次创下新纪录。其中1428篇论文入选,入选率仅为21.1%。百度共有8篇论文被收录,涵盖量化压缩、对抗训练等多个前沿方向。
在竞赛方面,百度在NeurIPS 2019的Learn to Move强化学习赛事中再度夺冠,并受邀在Deep RL Workshop中进行专题报告。比赛中,百度基于飞桨的强化学习框架PARL不仅成功完成挑战,还大幅领先第二名(1490 vs 1346),并在Best Performance Track和Machine Learning Track中分别获得第一名和最佳论文奖。
这些成果展示了百度在自然语言处理领域的技术实力和国际影响力。除了学术交流和报告外,百度展台也吸引了大量参会者前来咨询使用及合作事宜。百度AI同传系统也得到了来自全球多个国家和地区参与者的体验和认可。
从专题研讨、论文分享、竞赛报告到多样化的现场系统演示,百度在NeurIPS 2019上的全面参与,充分展示了其前沿的技术进展。以百度为代表的中国AI企业在国际学术会议上日益活跃,已成为一种新常态。