近年来,人工智能(AI)在处理单一模态的问题,如语音识别、自然语言处理和视觉识别等方面取得了显著进展。在这些单一模态的任务中,例如物体识别、语音识别和机器翻译,AI系统在特定数据集上的表现已接近人类水平。然而,研究人员逐渐认识到,更复杂的任务通常需要跨多种模态的信息处理。因此,研究多模态建模和学习方法变得尤为重要。
在最近举行的国际自然语言处理与中文计算会议(NLPCC 2020)上,京东智联云举办了第一届“多模态自然语言处理研讨会”。此次研讨会邀请了多位学术专家进行学术分享,吸引了众多来自自然语言处理、多模态和图像处理领域的学者参加。会议期间,学者们围绕跨语言跨模态信息处理、多模态预训练、AI与艺术、视觉与语言交互及多模态对话系统等热点话题展开了热烈讨论。
看点一:多模态自动摘要生成
多模态已经成为新闻报道和信息传播的主要形式之一,多模态自动摘要技术通过计算机自动从多个模态的信息中生成摘要,广泛应用于新闻推送和电商推荐等领域。
在此次研讨会上,中科院自动化所研究员张家俊介绍了其团队在多模态摘要方法和评估方面的研究成果。张家俊详细阐述了从抽取式方法到生成式方法,再到目前融合多模态注意力机制的图文摘要生成方法的发展过程。他还介绍了多模态自动摘要的自动评估方法,综合考虑文本和图片的重要性以及文本与图片的相关性,以更好地模拟人工评分。
看点二:多模态预训练模型
预训练模型的出现使得自然语言处理技术进入了大规模、可复制的应用阶段。这一阶段通过预训练模型加上微调机制,展现出极高的可扩展性和潜力。目前的研究已从单一语言扩展到多模态领域。
微软亚洲研究院高级研究员段楠博士介绍了多模态预训练模型的最新进展。他首先回顾了典型的预训练模型,随后重点介绍了三种最新的多模态预训练模型:Unicoder主要用于跨语言的语言理解和生成任务;Unicoder VL专注于视频和语言任务,对视频片段和对应的自然语言描述进行联合建模;CodeBERT则关注代码语言任务。段博士还与参会学者共同探讨了当前多模态预训练存在的问题及未来可能的发展方向。
看点三:人工智能艺术与设计
“AI+艺术”是一个跨学科领域,艺术家的想象力常常激发科学家的创造力。在AI时代,艺术家利用人工智能技术和机器学习创作艺术作品,表达自己的想法和理念,而设计师则使用神经网络模型创造设计工具和助手。
清华大学未来实验室博士后高峰分享了AI技术在艺术与设计领域的创新应用。其团队开发的道子智能绘画系统,通过计算机将自然图像转化为艺术图像,并将其用于水墨画创作,实现了技术与艺术的融合。高峰还介绍了道子系统在服装设计、工业设计和装置艺术等领域的探索成果。
看点四:多模态智能分析
多模态智能分析是近期的研究热点之一。来自北京航空航天大学的刘偲教授围绕视觉和语言的交互进行了分享。她首先介绍了视觉关系检测的研究,包括人-物关系检测、人-物关系分割和视频关系检测等内容。此外,刘教授指出,传统的视觉指代表达和指代分割方法存在复杂度高、速度慢的问题,而缺乏利用语言信息进行上下文建模和推理的能力。为此,她提出了一种改进的方法。
看点五:多模态对话系统
对话系统一直是自然语言处理的重要研究内容之一,可以帮助人们更方便地与机器进行交互。多模态对话系统则是这一领域的重要发展方向。
平安寿险AI研发团队的杨海钦博士分享了多模态对话系统在平安寿险不同场景中的应用,包括保单回访服务和视频柜员客服等。在本次讲座中,杨博士重点介绍了多模态对话系统的核心技术和创新方法,以及实际部署的经验,如何通过该系统降低运营成本并提升用户体验。
此次NLPCC会议上,京东智联云成功举办了第一届“多模态自然语言处理研讨会”,吸引了众多学者的积极参与和热烈讨论。此外,京东AI研究院的吴友政博士受邀作了关于智能人机交互及其应用的主题演讲。同时,京东AI研究院的一篇论文也被大会收录并进行了报告。