近年来,人工智能(AI)在处理单一模态任务,如物体识别、语音识别、机器翻译等方面取得了显著进展。然而,随着这些问题的逐步解决,研究人员意识到,更高层次的AI任务通常需要处理跨多种模式的复杂信息。这使得跨模态信息处理变得至关重要,而单一模态的研究往往难以充分利用这一优势。因此,研究多模态建模与学习方法显得尤为重要。
在最近举办的国际自然语言处理与中文计算会议(NLPCC 2020)上,京东智联云主办了首届“多模态自然语言处理研讨会”。这次研讨会汇聚了众多学术界的大咖,吸引了来自自然语言处理、多模态、图像处理等领域的专家学者参与。研讨会上,各位学者就跨语言跨模态信息处理、多模态预训练、AI与艺术、视觉与语言交互、多模态对话系统等领域的研究热点和技术应用展开了热烈讨论。
多模态已成为新闻报道和信息交流的重要形式,多模态自动摘要技术能够从多个模态的信息中自动生成摘要,应用范围广泛,包括新闻推送和电商推荐等领域。在本次研讨会上,中科院自动化所的研究员张家俊详细介绍了课题组近年来在多模态摘要方法和评价方面的研究成果。他着重讲述了异源多模态摘要生成的方法变迁,从最初的抽取式方法到生成式方法,再到目前的图文式摘要生成方法,这些方法都融入了多模态注意力机制。此外,他还介绍了多模态自动摘要的自动评价方法,这种方法综合考虑了文本和图片的重要性以及文本和图片的相关性,更接近人工评分标准。
预训练模型的出现,使得自然语言处理从手工调参和依赖专家的时代进入了大规模、可复制的大工业阶段。基于预训练模型和微调机制,该领域展现出很高的扩展性和潜力。当前研究已从单一语言扩展到了多模态领域。微软亚洲研究院的高级研究员段楠博士介绍了多模态预训练模型的最新研究进展。他首先回顾了经典的预训练模型,然后重点介绍了三种最新的多模态预训练模型:Unicoder主要用于跨语言的语言理解和生成任务;Unicoder VL专注于视频语言任务,对视频片段和相应的自然语言描述进行联合建模;CodeBERT则关注代码语言任务。段博士还与参会学者共同探讨了当前多模态预训练存在的问题及未来的发展方向。
“AI+艺术”是一个跨界的领域。艺术家的想象力常常激发科学家的创造力,而在AI时代,艺术家们利用人工智能和机器学习技术创作艺术作品,表达自己的想法和概念。设计师们则运用神经网络模型创建自己的设计工具和助手。清华大学未来实验室的博士后高峰分享了AI技术在艺术与设计领域的创新应用。他的团队开发了一套名为道子的智能绘画系统,该系统利用计算机将自然图像转化为艺术图像,再通过风格迁移技术将其转换为水墨画,实现了技术和艺术之间的跨界融合。高峰博士还介绍了道子系统在服装设计、工业设计和装置艺术等领域的探索成果。
多模态智能分析是近期的研究热点之一。北京航空航天大学的刘偲教授分享了关于视觉和语言交互的研究成果。她首先介绍了视觉关系检测的研究,包括人-物关系检测、人-物关系分割、视频关系检测等内容。此外,她还指出,视觉指代表达和指代分割对于智能机器人和交互式图像编辑等实际应用具有重要意义。传统的视觉指代表达方法采用两阶段式架构,模型复杂且速度受限;而传统的指代分割方法侧重于多模态特征融合,缺乏利用语言信息进行上下文建模和推理的能力。刘教授提出了针对这些问题的解决方案。
对话系统一直是自然语言处理领域的一个重要研究方向,它使人们能更方便地与机器交互。多模态对话系统则是这一领域的重要研究方向之一。平安寿险AI研发团队的杨海钦博士分享了多模态对话系统在平安人寿不同场景中的应用案例,包括保单回访服务和视频柜员客服等。在此次讲座中,杨博士重点介绍了多模态对话系统的核心技术和创新技术,分享了实际部署的经验,并讨论了如何利用该系统降低成本、提升用户体验。
此次NLPCC会议上,京东智联云成功举办了首届“多模态自然语言处理研讨会”,吸引了众多参会者的积极参与和热烈讨论。此外,京东AI研究院的吴友政博士受邀作了题为“智能人机交互及其应用”的主题演讲。京东AI研究院的一篇论文也在大会上进行了口头汇报。