嗨,大家好!这里是学术报告专栏,读芯术小编会定期挑选并亲自参加重要的学术会议,为大家带来科技领域最优质的学术报告。我们会记录报告的核心内容,并努力获取最新的PPT和现场视频——确保内容充实、新颖!话不多说,赶快来看看这些精彩的学术报告吧,相信它们能让你的专业知识更加丰富。
人工智能领域的论坛层出不穷,但真正有价值的讲座却很少。由中科院大学主办、百度全力支持的“AI将来说·青年学术论坛”系列讲座,汇集了读芯术、paperweekly等知名自媒体,以及多个学院的积极参与。2020年6月20日,第16期“AI将来说·青年学术论坛”在线上举行,主题为“NLP前沿技术及产业化”,复旦大学的黄萱菁教授带来了题为《自然语言处理中的表示学习》的报告。
黄萱菁教授是复旦大学计算机科学技术学院的教授和博士生导师。她于1998年在复旦大学获得计算机科学博士学位,研究方向涵盖人工智能、自然语言处理、信息检索和社会媒体分析。她是多个学术组织的重要成员,如中国中文信息学会常务理事、社会媒体专委会副主任等。黄教授在高水平国际期刊和会议上发表了近百篇论文,并主持多项受到国家自然科学基金、科技部、教育部、上海市科委支持的科研项目。她还曾多次担任重要学术职务,并入选“2020年度人工智能全球女性”及“2020年度AI 2000人工智能全球最具影响力提名学者”。
黄萱菁教授首先介绍了自然语言处理中的表示学习。表示学习是从认知科学和人工智能的角度来定义的。从认知科学角度看,表示学习是指语言在人脑中的表现方式,关系到理解和生成语言的过程;从人工智能角度来看,表示学习则是将语言转化为计算机可以处理的形式,以便进行自动化处理。好的文本表示需要具备强大的表示能力,例如具有一定的深度、简化后续任务、具有通用性等。
早期的表示方法主要采用符号化的离散表示,如词表示为One-Hot向量,而现代表示方法则采用更精确的数学表示,通常基于深度学习。深度学习不需要人工设计特征,能够自动进行表示学习,这在自然语言处理的许多任务中都取得了显著进展,如分词、词性标注、命名实体识别等。
词语表示学习,又称词嵌入,是指将词语从符号空间映射到向量空间。2013年之前,仅有少量工作研究词嵌入,其中包括Bengio提出的神经语言模型。2013年后,出现了大量新工作,特别是word2vec和glove。2016年后,词嵌入的研究进入短暂冷却期,但2018年后再次兴起,出现了上下文相关的词向量学习方法,如Elmo和Bert。这些方法大大提升了词表示的质量。
句子表示方法与短语表示方法类似,都是基于神经网络的表示学习。句子表示方法可以用于文本分类、匹配、阅读理解等具体任务。黄教授的研究团队在句子建模方面做了大量工作,开发了基于门机制的递归神经网络,引入了卷积神经网络,提出了树结构LSTM等方法,提升了语义结构的组合能力。
许多自然语言处理任务可以建模为句对编码任务,例如句子的重述、包含分析、语篇分析等。黄教授的研究团队在句对表示学习方面的工作包括对语篇关系的检测,利用词向量差值和Fisher Vector方法进行句间关系分类,以及门相关性网络等。
黄教授还介绍了近期的研究趋势,包括模型层面的图神经网络和Transformer,学习层面的元学习、多任务学习和迁移学习,以及理解与解释层面的研究。这些研究不仅提升了自然语言处理的效果,也为模型的可解释性提供了新的视角。
当前自然语言处理面临的主要挑战包括模型的可解释性问题。许多模型虽然功能强大,但难以理解其内部机制。黄教授的研究团队在这一领域做出了许多贡献,推动了自然语言处理技术的发展。
以上就是黄萱菁教授在“AI将来说·青年学术论坛”中的精彩报告内容。希望这些信息对你有所帮助!